¿Qué necesito para aplicar cada análisis?
Referencia rápida de condiciones/supuestos, inspirada en el tipo de chequeo que hace G*Power antes de correr una prueba. Antes de interpretar cualquier resultado, revisa que se cumplan (o sepas por qué no se cumplen).
📊 ANOVA de un factor (paramétrico)
-
Variable dependiente:
cuantitativa, medida en escala de intervalo o razón.
-
Factor:
categórico (2 o más grupos independientes).
-
Independencia:
las observaciones dentro y entre grupos deben ser independientes (no medidas repetidas).
-
Normalidad:
la variable dependiente debe distribuirse aproximadamente normal dentro de cada grupo (Shapiro-Wilk / Kolmogorov-Smirnov, p ≥ .05). Con n por grupo > 30, el ANOVA es razonablemente robusto a violaciones leves (Teorema Central del Límite).
-
Homocedasticidad:
varianzas similares entre grupos (Levene, p ≥ .05). Si se viola, usar Welch-ANOVA o Kruskal-Wallis.
-
Tamaño muestral:
suficiente para la potencia deseada — revisa la sección de potencia estadística para saber cuántas observaciones necesitas para tu tamaño de efecto.
-
Si no se cumple normalidad/homocedasticidad:
usa Kruskal-Wallis (alternativa no paramétrica, basada en rangos).
📉 Kruskal-Wallis (no paramétrico)
-
Variable dependiente:
al menos ordinal (también sirve para cuantitativa que no cumple normalidad).
-
Factor:
categórico, 2+ grupos independientes.
-
No requiere:
normalidad ni homocedasticidad estricta, pero sí requiere que las distribuciones tengan forma similar entre grupos para que la interpretación en términos de medianas sea válida.
-
Post-hoc:
prueba de Dunn con corrección (Bonferroni u otra) para comparaciones por pares.
📐 ANCOVA
- Todos los supuestos del ANOVA, más:
-
Covariable:
cuantitativa, relacionada linealmente con la variable dependiente.
-
Homogeneidad de pendientes:
la relación entre la covariable y la VD debe ser similar en todos los grupos (no debe existir interacción factor×covariable).
-
Independencia entre factor y covariable:
idealmente la covariable no debería estar fuertemente asociada al factor de grupo.
🧮 MANOVA
-
Variables dependientes:
2 o más, cuantitativas y correlacionadas entre sí (si no están correlacionadas, mejor usar ANOVAs separados).
-
Normalidad multivariante
de las variables dependientes dentro de cada grupo.
-
Homogeneidad de matrices de varianza-covarianza
entre grupos (Box's M).
-
Tamaño muestral:
cada grupo debe tener más observaciones que el número de variables dependientes.
🔗 Correlación (Pearson / Spearman / Kendall)
-
Pearson:
ambas variables cuantitativas, relación lineal, normalidad bivariada aproximada, sin outliers extremos.
-
Spearman/Kendall:
alternativas robustas cuando la relación es monótona pero no lineal, hay outliers, o las variables son ordinales.
-
Correlación no implica causalidad:
siempre acláralo al reportar.
📈 Regresión lineal / múltiple
-
Linealidad:
la relación entre predictores y variable dependiente debe ser aproximadamente lineal.
-
Independencia de los residuos
(importante en datos con estructura temporal o jerárquica).
-
Homocedasticidad de los residuos
(varianza constante en el gráfico 'Residuals vs Fitted').
-
Normalidad de los residuos
(no de las variables originales) — revisar el QQ-plot de residuos.
-
Ausencia de multicolinealidad severa
entre predictores (VIF < 5-10, idealmente < 5).
-
Sin observaciones influyentes extremas
(revisar distancia de Cook / leverage).
🔲 Chi-cuadrado de independencia
-
Ambas variables:
categóricas (nominales u ordinales).
-
Independencia de observaciones:
cada sujeto aporta una sola observación.
-
Frecuencias esperadas:
idealmente todas las celdas con frecuencia esperada ≥ 5 (si no se cumple, considerar la prueba exacta de Fisher).
✅ Confiabilidad (Alfa de Cronbach) y PCA
-
Ítems:
cuantitativos, medidos en la misma escala (ej. Likert 1-5), pensados para medir un mismo constructo.
-
Al menos 3 ítems
por escala (idealmente más) y muestra suficiente (regla práctica: n ≥ 5-10 por ítem para PCA).
-
Ítems redactados en sentido inverso:
deben identificarse y recodificarse (la app lo hace automáticamente con check.keys).
-
Para PCA:
variables correlacionadas entre sí (KMO adecuado, prueba de esfericidad de Bartlett significativa).
🔵 Análisis de clúster (K-means / Jerárquico)
-
Variables:
cuantitativas, idealmente escaladas/estandarizadas si tienen unidades distintas.
-
Sin variables redundantes:
variables muy correlacionadas entre sí pueden sesgar la distancia y dominar la agrupación.
-
K-means:
asume clústeres de forma esférica y tamaño similar; sensible a outliers.
-
Jerárquico:
no requiere definir k de antemano, pero es más sensible al método de enlace elegido.
📝 Análisis de sentimientos y frecuencia de palabras
-
Texto:
libre, en español, con suficiente longitud (respuestas de una sola palabra dan poca información).
-
Limitación importante:
el diccionario NRC es automático y no entiende sarcasmo, negaciones complejas ni contexto cultural específico — úsalo como apoyo exploratorio, no como verdad absoluta.
⚡ Potencia estadística — ¿qué significa?
La potencia (1-β) es la probabilidad de detectar un efecto verdadero si este realmente existe. Depende de 4 elementos que se relacionan entre sí (como en G*Power): tamaño del efecto, tamaño muestral, nivel de significancia (α) y la propia potencia. Fijando 3 de estos, se puede calcular el cuarto.
-
Potencia ≥ .80:
estándar convencional aceptable en ciencias sociales/salud.
-
Potencia baja:
un resultado 'no significativo' no es evidencia confiable de que no hay efecto — puede deberse simplemente a una muestra pequeña.
-
Tamaño de efecto (f de Cohen para ANOVA):
.10 = pequeño, .25 = mediano, .40 = grande.
📏 Curtosis: meso / lepto / platicúrtica
-
Mesocúrtica:
exceso de curtosis ≈ 0, apuntamiento similar al de una distribución normal.
-
Leptocúrtica:
exceso de curtosis > 0, distribución más apuntada, colas más pesadas (más valores extremos de lo esperado bajo normalidad).
-
Platicúrtica:
exceso de curtosis < 0, distribución más aplanada, colas más ligeras (datos más dispersos alrededor de la media).