lunes, 9 de diciembre de 2013

Taller 3er Corte. Ejercicio 6 Regreción Lineal Grupo: Arcia, Gracia y González

REGRESIÓN LINEAL

La Regresión y la correlación son dos técnicas estadísticas que se pueden utilizar para solucionar problemas comunes en los negocios.
Muchos estudios se basan en la creencia de que es posible identificar y cuantificar alguna Relación Funcional entre dos o más variables, donde una variable depende de la otra variable.
Se puede decir que Y depende de X, en donde Y y X son dos variables cualquiera en un modelo de Regresión Simple
"Y es una función de X"
Y = f(X)
Como Y depende de X,
Y es la variable dependiente, y
X es la variable independiente.
En el Modelo de Regresión es muy importante identificar cuál es la variable dependiente y cuál es la variable independiente.
En el Modelo de Regresión Simple se establece que Y es una función de sólo una variable independiente, razón por la cual se le denomina también Regresión Divariada porque sólo hay dos variables, una dependiente y otra independiente y se representa así:
Y = f (X)
"Y está regresando por X"

La variable dependiente es la variable que se desea explicar, predecir. 
La variable Independiente X se le denomina variable explicativa o regresor  y se le utiliza para explicar Y.

ANÁLISIS ESTADÍSTICO: REGRESIÓN LINEAL SIMPLE

En el estudio de la relación funcional entre dos variables poblacionales, una variable X, llamada independiente, explicativa o de predicción y una variable Y, llamada dependiente o variable respuesta, presenta la siguiente notación:

Y = a + b X + e
Donde:
a es el valor de la ordenada donde la línea de regresión se intercepta con el eje Y.
b es el coeficiente de regresión poblacional (pendiente de la línea recta)
e es el error

Suposiciones de la Regresión Lineal 
  1. Los valores de la variable independiente X son fijos, medidos sin error.
  2. La variable Y es aleatoria
  3. Para cada valor de X, existe una distribución normal de valores de Y (sub-poblaciones Y)
  4. Las variancias de las sub-poblaciones Y son todas iguales.
  5. Todas las medias de las sub-poblaciones de Y están sobre la recta.
  6. Los valores de Y están normalmente distribuidos y son estadísticamente independientes.

Estimación de la Ecuación de Regreción Muestral

Consiste en determinar los valores de "a" y "b " a partir de la muestra, es decir, encontrar los valores de a y b con los datos observados de la muestra. El método de estimación es el de Mínimos Cuadrados, mediante el cual se obtiene:

Luego, la ecuación de regresión muestral estimada es
Que se interpreta como:
a es el estimador de a
Es el valor estimado de la variable Y cuando la variable X = 0
b es el estimador de b , es el coeficiente de regresión
Está expresado en las mismas unidades de Y por cada unidad de X. Indica el número de unidades en que varía Y cuando se produce un cambio, en una unidad, en X (pendiente de la recta de regresión).
Un valor negativo de b sería interpretado como la magnitud del decremento en Y por cada unidad de aumento en X.

EJERCICIO:

Una Compañía de seguros desea determinar el grado de relación que existe entre el ingreso
familiar X y el monto del seguro de vida Y del jefe de familia. Con base a una muestra aleatoria de 18 familias, se obtuvo la siguiente información. 


a) Realice un gráfico adecuado
b) Para un modelo de regresión lineal simple, obtenga la recta de regresión ajustada y grafíquela sobre (a).
c) Explicar el análisis de regresión.

SOLUCIÓN

1.- Tomamos los datos del ejercicio y lo introducimos en la calculadora online sugerida. http://www.alcula.com/calculators/statistics/linear-regression/


2.- Al introducir los datos el valor que nos dará es nuestro coeficiente de relación.


3.- Luego de obtener dicho resultado, hacemos click en "Regresión Lineal" Para obtener la gráfica. 





4.- La calculadora nos arrojo la formula para determinar el grado de relación que existe entre  el ingreso familiar y el monto de seguro de vida. 

5.- El problema dice que la muestra aleatoria es de 18, este seria el valor del ingreso familiar, el cual sustituiremos por X.

y = 36.433721224387 0.75227675183405 (18)
y = 49,944702757399896


R= LA RELACIÓN QUE EXISTE ENTRE EL INGRESO FAMILIAR Y EL MONTO DEL SEGURO DE VIDA DE LAS 18 FAMILIAS ES DE:

49,944702757399896 = 50 Unidades Monetarias



Integrates:

Thomas A. González
Carlos Arcia
Eduardo García. 

viernes, 6 de diciembre de 2013

Taller del 3er Corte Estadística Aplicada

Los siguientes ejercicios corresponde  taller del 3er corte, están distribuidos de la siguiente forma.
Ejercicio 1: Grupo ( Danott, Carlucio y Sanchez) responsable en publicar Darnott.
La Empresa Serrviya esta analizando la calidad del servicio, para ello,  trata de ver si el número de reclamaciones depende de la cuadrilla para un 5% de nivel de significancia.  Ho: Los rechazos son independientes de la cuadrilla. Ha: los rechazos dependen de la cuadrilla

Cuadrilla
Servicio no rechazado
Servicio Rechazado

Diurna
215
35
Vespertina
150
44
Nocturna
210
40
Ejercicio 2: Grupo ( Blaquez, Silva y Valero) responsable en publicar Blaquez.
Los datos de 3 proveedores en relación a partes defectuosas es como sigue:
Probar a un 5% de significancia si los defectos dependen del tipo de proveedor. 

Proveedor
Buenos
Con Def menores
Con def graves
A
185
8
7
B
170
18
7
C
135
6
9


Ejercicio 3: Grupo ( Betancourt, Lepaje y Verde) responsable en publicar Betancour. 
Los técnicos de una industria papelera deciden realizar un experimento para ver qué variedad de árbol produce un menor contenido en los desechos de pasta de papel. Los datos representan, en porcentaje, la cantidad obtenida:
Árbol variedad A     1.9   1.8    2.1    18
Árbol variedad B      1.6   1.1   1.3   1.4   1.1
Árbol variedad C      1.3    1.6   1.8   1.1   1.5   1.1
Ejercicio 4: Grupo ( Ibarra, Perez y Fuentes) responsable en publicar Fuentes. 
Un fabricante de papel para elaborar caramelos está interesado en mejorar la resistencia a la tensión del producto. El grupo de diseño piensa que la concentración de madera se  relaciona con la resistencia de la tensión del producto. Se decide un estudio con cuatro niveles de concentración de madera (5%, 10% 15% y 20%). Los resultados se presentan a continuación:

Replicas
% concentración de madera
5
10
15
20
1
7
12
14
19
2
8
17
18
25
3
15
13
19
22
4
11
18
17
23

¿La concentración de la madera mejora la resistencia  del producto?, Al nivel de significancia de 0.05.

  • Explicar el método de análisis de varianza 2 factor (ANOVA)
  • Resolver el ejercicio aplicando los pasos de la prueba de hipótesis.
  • Utilizar este programa recomendado Excel 
Ejercicio 5: Grupo ( Guerra, Navarro y Cedeño) responsable en publicar Navarro. 
Una cadena de restaurantes de comida rápida decide llevar a cabo un experimento 
para medir la influencia sobre las ventas del gasto en publicidad. En ocho regiones 
del país, se realizaron diferentes variaciones relativas en el gasto de publicidad, 
comparado con el año anterior, y se observaron las variaciones en los niveles de 
ventas resultantes. La tabla adjunta muestra los resultados. 

Incremento del Gasto en Publicidad (%)   1    4    14      10     9       8     6    1 
Incremento en las Ventas (%)                 2,4 7,2  10,3   9,1  10,2  4,1  7,6  3,5 

a) Realice un gráfico adecuado. 
b) Para un modelo de regresión lineal simple, obtenga la recta de regresión ajustada  y grafíquela sobre (a)
c) Explicar el análisis de regresión.
D) Utilizar este programa recomendado http://www.easycalculation.com/statistics/regression.php

Ejercicio 6: Grupo ( Arcia, Garcia y Gonzalez) responsable en publicar Gonzalez. 
Una compañía de seguros desea determinar el grado de relación que existe entre el ingreso familiar x y el monto del seguro de vida Y del jefe de familia. Con base a una muestra aleatoria de 18 familias, se obtuvo la siguiente información. (en miles bolivariano/anual
            Ingreso 45  20  40  40  47  30  5 20  15 
Seguro de Vida 70  50  60  50  90  75 55  35  40 
a) Realice un gráfico adecuado. 
b) Para un modelo de regresión lineal simple, obtenga la recta de regresión ajustada  y grafíquela sobre (a)
c) Explicar el análisis de regresión.

Ejercicio 7: Grupo ( Moreno, Mendez y Cordova) responsable en publicar Cordova 
En base al porcentaje de puntualidad se trata de ver si hay correlación con las quejas en una línea aérea. Las quejas son por cada 100000 pasajeros.

%puntos
Quejas
Aerolinea
X
Y
A
81.8
0.21
B
76.6
0.58
C
76.6
0.85
D
75.7
0.68
E
73.8
0.74
F
72.2
0.93
G
70.8
0.72
H
68.5
1.22
a) Trazar un diagrama de dispersión
b) Obtener el coeficiente de correlación y de determinación
c) Explicar el coeficiente obtenido.
D) Utilizar este programa recomendado http://www.easycalculation.com/statistics/correlation.php

Ejercicio 8: Grupo (Borges,  y Amundarain) responsable en publicar  Amundarain 
La energía consumida en un proceso depende del ajuste de máquinas que se realice, realizar  una correlación cuadrática con los datos siguientes y responder las preguntas.

Consumo
energía
Ajuste Máq.
Y
X
21.6
11.15
4
15.7
1.8
18.9
1
19.4
1
21.4
0.8
21.7
3.8
25.3
7.4
26.4
4.3
26.7
a) Trazar un diagrama de dispersión
bObtener el coeficiente de correlación y de determinación
c) Explicar el coeficiente obtenido.

Ejercicio 9: Grupo (Shariff Nasser,  y grupo) responsable en publicar  Shariff Nasser 
La tabla muestra la eficiencia y rendimiento de las ventas de 18 empleados en tres unidades de negocio. Se muestran a continuación: Probar si no hay diferencia significativa del rendimiento de las ventas entre las unidades a un 5% de nivel de significancia.


A
B
C
85
71
59
75
75
64
82
73
62
76
74
69
71
69
75
85
82
67
RECOMENDACIONES:
  •       PUBLICAR HASTA EL DÍA 10-12-13
  •       Investigar los aspecto teórico de su ejercicio seleccionado.
  •       Ajustar la publicación al tamaño del blog, no salirse de la plantilla
  •       Concluir el ejercicio con un análisis de los aspecto mas relevante.
  •       Señalar la bibliográfica o las referencia consultadas


martes, 12 de noviembre de 2013

Importancia de las Medidas de Tendencia Central y Dispersión


Las medidas de Tendencia Central son empleadas para resumir a los conjuntos de datos que serán sometidos a un estudio estadístico, se les llama medidas de tendencia central porque general mente la acumulación más alta de datos se encuentra en los valores intermedios. Estas medidas son utilizadas con gran frecuencias como medidas descriptivas de poblaciones o muestras.

Las mas empleadas
1. Moda - Es el valor con una mayor frecuencia en una distribución de datos.
2. Mediana – Representa el valor de la variable que deja por debajo de sí a la mitad de los datos en un conjunto ordenados de menor a mayor.
3. Media – Promedio o valor obtenido por la suma de todos los datos (valores) dividida entre el número de sumandos. 

MEDIDAS DE DISPERSIÓN Hacen referencia a la variabilidad, o la evaluación de cuán separados o extendidos están los datos o bien cuanto difieren unos de otros. Entendiéndose la variación, como el grado en que los datos numéricos tienden a distribuirse alrededor de un valor central. ¿Para que sirven? Identificar si una medida central, es adecuado para representar la población de datos Indicar la relación de un dato con los otros Comprender el riesgo para poder tomar decisiones Son de gran utilidad al comparar distribuciones.

Se plantea las siguientes interrogantes, por favor contestar máximo en 8 líneas.

¿Qué aplicaciones se le puede dar a las Medidas de Tendencia Central y a las Medidas de Dispersión?

¿Cuál es la importancia de estas medidas para la estadística?