Calculadora del Coeficiente de Correlación

r de Pearson
Siguiente

El coeficiente de correlación de Pearson (r) cuantifica la relación lineal entre dos variables: cuán estrechamente se mueven juntas. Esta calculadora toma valores emparejados X/Y y calcula r y r-cuadrado (la proporción de varianza explicada), además del número de pares usados.

Cómo calcular la correlación

  1. 1

    Pega datos emparejados

    Un valor X y un valor Y por fila, separados por comas o tabulaciones. O pega desde una hoja de cálculo.

  2. 2

    Ejecuta el cálculo

    La calculadora los empareja, calcula medias, desviaciones y la fórmula de Pearson.

  3. 3

    Lee r y r²

    r varía de -1 a +1. r² es su cuadrado, interpretable como porcentaje de varianza compartida.

  4. 4

    Ten en cuenta el tamaño de la muestra

    Revisa el número de pares (n) que se muestra junto a los resultados. Con muestras pequeñas, r no es fiable, así que indica n junto a r.

La fórmula

r = Σ((xᵢ - x̄)(yᵢ - ȳ)) / √(Σ(xᵢ - x̄)² × Σ(yᵢ - ȳ)²)

Equivalente: r = cov(X, Y) / (σ_X × σ_Y). Es la covarianza normalizada por el producto de las desviaciones estándar, lo que fuerza el resultado en [-1, +1].

Interpretando r

valor de r relación lineal
±0,9 a ±1,0 Muy fuerte
±0,7 a ±0,9 Fuerte
±0,5 a ±0,7 Moderada
±0,3 a ±0,5 Débil
±0,0 a ±0,3 Muy débil o ninguna

r² (coeficiente de determinación) es la fracción de varianza en Y explicada por un modelo lineal en X. r = 0,7 significa r² = 0,49, aproximadamente la mitad de la varianza es lineal, la mitad no lo es.

Cuando Pearson es la herramienta equivocada

Pearson asume una relación lineal con datos aproximadamente normales y sin grandes valores atípicos. Falla gravemente en:

  • Relaciones curvas: y = x² en el rango [-5, 5] tiene r = 0 a pesar de ser perfectamente predecible.
  • Valores atípicos: un solo punto a 5 desviaciones estándar puede duplicar o reducir a la mitad r.
  • Datos de rango: usa ρ de Spearman (correlación de rangos) en su lugar.
  • Datos binarios o categóricos: usa la correlación biserial puntual, el coeficiente phi o la V de Cramér según el tipo de datos.

La correlación no es causalidad: el clásico

Dos variables pueden correlacionarse fuertemente porque:

  1. X causa Y.
  2. Y causa X.
  3. Una tercera variable Z causa ambas (confusión).
  4. Pura casualidad (en muestras pequeñas).
  5. Sesgo de selección en cómo se recogieron los datos.

Las ventas de helados y las muertes por ahogamiento correlacionan +0,8 durante los meses de verano. El helado no causa ahogamientos, el clima cálido causa ambos.

Tamaño de la muestra y significancia

Un r de muestra pequeña puede ser engañoso. Para n = 5, r = 0,5 no es estadísticamente distinguible de cero (p ≈ 0,4). Para n = 100, r = 0,2 es claramente distinto de cero (p < 0,05). Siempre reporta el tamaño de la muestra junto con r. Un valor p para r prueba la hipótesis nula de que la verdadera correlación es cero.

Preguntas frecuentes

Una relación lineal positiva moderada. r² = 0,25, por lo que aproximadamente el 25 % de la varianza en Y se explica linealmente por X; el 75% no se explica. Ese es un efecto real pero lejos de ser determinista.

No, por construcción. Si tu resultado está fuera de [-1, 1] el cálculo tiene un error, típicamente por datos mal emparejados o por calcular la covarianza sin normalizar por las desviaciones estándar.

Pearson para relaciones lineales en datos continuos sin grandes valores atípicos. Spearman (correlación de rangos) para relaciones monótonas pero no lineales o cuando los valores atípicos están afectando a Pearson.

No. Es una descripción de la muestra que tienes, no una predicción. La validación cruzada, un conjunto de prueba retenido o un intervalo de confianza sobre r son las formas honestas de verificar la estabilidad.

Herramientas relacionadas