jueves, 1 de junio de 2017

TEMA 10: HIPÓTESIS ESTADÍSTICA. TEST DE HIPÓTESIS

1. Contrastes de hipótesis

- Sirven para controlar los errores aleatorios, además del cálculo de intervalos de confianza, contamos con una segunda herramienta en el proceso de inferencia estadística: los test o contrastes de hipótesis.
- Con los contrastes (test) de hipótesis, la estrategia es la siguiente:
  • Estableceremos a priori una hipótesis acerca del valor del parámetro
  • Realizamos la recogida de datos
  • Analizamos la coherencia entre la hipótesis previa y los datos recogidos

2. Errores de hipótesis 

- Con una misma muestra podemos aceptar o rechazar la hipótesis nula, todo depende de un error al que llamamos α.
- El error α es la probabilidad de equivocarnos al rechazar la hipótesis nula
- El error α más pequeño al que podemos rechazar la hipótesis nula es el error p.
- Habitualmente rechazamos la hipótesis nula para un nivel α máximo del 5% (p < 0,05)
Es lo que llamamos “simplificación estadística

3. Tipos de errores en el test de hipótesis 

Resultado del test à
Realidad
Rechazo Ho
Acepto Ho
Ho cierta
Error tipo 1 (errorα)
No error (1- α)
Ho falsa
No error (1 – β)
Error tipo II (errorβ)

4. Test de hipótesis: chi cuadrado 

- Para comparar variables cualitativas (dependiente e independiente)
- Razonamiento a seguir: suponemos la hipótesis cierta y estudiamos cómo es de probable que siendo iguales los 2 grupos a comparar se obtengan resultados con los obtenidos o haber encontrado diferencias más grandes por grupos.
- Tienen que cumplirse los siguientes condiciones, a parte de ser cualitativa vs cualitativa, para poder emplear este test de hipótesis:
  • n = 50
  • Las celdas e valores esperados no pueden ser < 5
- Resultados obtenidos:
  • Menor al valor de la tabla à se acepta Ho
  • Mayor al valor de la tabla à se rechaza Ho
- EJEMPLO: Estudio de 52 pacientes con ulceras por presión. 2 tratamientos: silvederma y blastoestimulina

Positiva
Negativa
TOTAL
Silvederma
11
15
26
Blastoestimulina
16
10
26
TOTAL
27
25
52
Ho = silvederma y blastoestimulina son igual de eficaces
H1 = silvederma es más eficaz que blastoestimulina
H2 = blastoestimulina es más eficaz que silvederma
Variable independiente =  tratamiento à silvederma y blastoestimulina
Variable dependiente = la evolución de la úlcera à positiva o negativa
LAS DOS SON VARIABLES CUALITATIVAS POLICOTÓMICAS
n = 52
nsilvederma = 26
nblastoestimulina = 26
  1. Grupo silvederma: 42,3% de respuesta positivas
  2. Grupo blastoestiulina: 61,5% de respuestas positivas
  3. Riesgo relativo: 1,46 à 61,5/42,3 = 1,46

VALORES ESPERADOS

Positivo
Negativo

Silvederma
13,5
12,5
26
Blastoestimulina
13,5
12,5
26

27
25
52
  • PS+ = (26 * 27)/52 = 13,5
  • PS- = (26 * 25)/52 = 12,5
  • PB+ = (26 * 27)/52 = 13,5
  • PB- = (26 * 25)/52 = 12,5

VALORES OBSERVADOS

Positivo
Negativo

Silvederma
11
15
26
Blastoestimulina
16
10
26

27
25
52
       E = Esperados                      O = Observados
X2 = 1.92
GRADO DE LIBERTAD  (G.L.) = (filas – 1)*(columnas – 1)
Aceptaríamos la hipótesis nula.
Al ser 1,92 menor que 3, 84 se aceptaría la hipótesis nula, pero si hubiese sido mayor a 3,84, se hubiese rechazado.

5. T de Student 

- Se utiliza cuando la variable independiente es cualitativa (dicotómica) y la variable dependiente es cuantitativa continua.
Solo sirve para comparar dos grupos y dos medias.
- Se plantea una hipótesis nula para saber si se rechaza o se aprueba
- Se calcula el grado de libertad.
- A partir de esta fórmula podemos calcular este test de hipótesis:
- Siendo sp la desviación estándar ponderada que se calcula de la siguiente manera:
Ejemplo:
H0= "Los apósitos de alginato tardan, por término medio, el mismo tiempo que los apósitos hidrocoloides, en regenerar tejidos de las UPP de III y IV grado".
Variable Independiente: Tipo de apósito empleado en las UPP de III y IV grado.
Variable Dependiente: Tiempo transcurrido en días desde la instauración de los apósitos hasta la regeneración de tejidos de las UPP.
ALGINATO n=10
HIDROCOLOIDES n=10
101
103
102
105
100
104
104
106
102
108
99
100
102
108
103
104
97
105
99
107
XA (media A) = 100.9
XH (media H) = 105
SA = 40.9 días
SB = 54 días
N = número de sujetos = 10 en cada grupo
Sp = desviación estándar

Sp = 2.296
T = 3.99
p < 0.05
Grado de libertad = n1 + n2 - 2 = 18
Como debería valer menos de 1.73, por lo que rechazamos la hipótesis nula

6. Test de Anova 

- Son test paramétrico, que es cuantitativo y de distribución anormal.
Variable independiente: cualitativa dicotómica, para comparar muchos tipos (más de 3)
- Variable dependiente: cuantitativa
- p > 0.05, acepto la hipótesis nula
- La diferencia entre la muestra mayor y la menor no puede superar el doble de cualquiera de los valores.
Divide la diferencia de grupos entre la diferencia entre cada grupo

7. Relación entre variables y regresión 

  • Cada peculiaridad en un hombre es compartido por sus descendientes, pero en media, en un grado menor. Regresión de la media
  • Su trabajo se centraba en la descripción de los rasgos físicos de los descendientes (una variable) a partir de los de sus padres (otra variable)
  • Pearson realizó un estudio con más de 1000 registros de grupos familiares observando una relación del tipo:

Altura del hijo = 85 cm + 0.5 a altura del padre (aproximadamente)
Conclusión: los padres muy altos tienen tendencia a acercarse (regresar) a la media. Lo mismo puede decirse de los padres muy bajos.

  • Hoy en día, el sentido de la regresión es la predicción de una medida basándonos en el conocimiento de otra.

8. Relación directa e inversa 

- Para los valores de X por encima de la media, tenemos valores de Y por encima y por debajo en proporciones similares (incorrelación)
Para los valores de X mayores que la media, le corresponden valores de Y mayores también
- Para los valores de X menores de la meda, le corresponde valores de Y menores también. Esto se llama relación directa (fuerte relación directa)
- Para los valores de X mayores que la media, le corresponden valores de Y menores. Esto es la relación inversa o decreciente (cierta relación inversa)

9. Modelos de análisis de regresión 


10. Regresión final simple: correlación y determinación

  • Se trata de estudiar la asociación lineal entre dos variables cuantitativas.
  • Ejemplo: influencia de la edad en las cifras de tensión arterial sistólica.
  • Regresión lineal simple: una sola variable independiente.
  • Regresión lineal múltiple: más de una variable independiente.
  • Ecuación de la recta y=ax + b (ej: TAS= a. edad + b)
  • Pendiente de la recta a=β1. El valor de a positivo la correlación entre las dos variables es directa y si el valor de a es negativo la correlación entre las dos variables es indirecta.
  • β1 expresa la cantidad de cambios que se produce en la variable dependiente por unidad de cambio de la variable independiente
  • β0 expresa cuál es el valor de la variable dependiente cuando la independiente vale 0
  • Punto de inserción con el eje de coordenadas b=βo
  • Modelos lineales deterministas: la variable independiente determine el valor de la variable dependiente. Entonces para cada valor de la variable independiente solo habría un valor de la dependiente.
  • Modelos lineales probabilísticos: para cada valor de la variable independiente existe una distribución de probabilidad de valores de la dependiente, con una probabilidad entre 0 y 1.
  • La recta a determinar es aquella con la menor de cada punto a ella.

Y= ß1 X + ß0
Yi= ß1 X + ß+ ei
  • Y sería la media de la variable dependiente en un grupo con el mismo valor de la variable independiente
  • Yi = y + ei
  • Para construir un modelo de regresión lineal hace falta conocer: Punto de inserción con el eje de coordenadas = ßy la pendiente de la recta a = ß(mayor valor de beta 1 la pendiente será muy pronunciada en sentido directo o inverso).
  • No hay modelo determinista: hay una nube de puntos y buscamos la recta que mejor explica el comportamiento de la variable dependiente en función de la variable independiente.
  • Coeficiente de correlación (Pearson y Speerman) : Número adimensional (entre -1 y 1) que mide la fuerza y el sentido de la relación lineal entre variables.

  • r = β1 * Sx/Sy                              r = 1 = 100%
  • Coeficiente de determinación: número adimensional (entre 0 y 1) que da idea de la relación entre las variables relacionadas linealmente, es r2. Se calcula a partir del coeficiente de correlación.
  • Cuanto más cerca del cero, más débil
  • Test de hipótesis T (tau de kendall):


No hay comentarios:

Publicar un comentario