Calculadora de Regresión Lineal

Recta de mejor ajuste
Resultados

La regresión lineal ajusta la única línea recta y = mx + b que minimiza la suma de los errores verticales al cuadrado de los datos. Es la primera herramienta a la que recurrir cuando sospechas que una variable impulsa a otra, gasto en publicidad vs. inscripciones, temperatura vs. ventas de helados, altura vs. talla de zapatos. Pega pares (x, y) y la calculadora devuelve la pendiente, la intersección, R-cuadrado y el coeficiente de correlación de Pearson.

Cómo ajustar una línea de regresión

  1. 1

    Pega los datos

    Un par por línea: x e y separados por coma, tabulación o espacio. Se ignoran los encabezados.

  2. 2

    Lee la pendiente y la intersección

    Pendiente m = cambio en y por cada cambio de 1 unidad en x. Intersección b = y cuando x = 0.

  3. 3

    Verifica R²

    R² ∈ [0, 1], la parte de la varianza en y explicada por x. 0.7+ suele ser fuerte en datos sociales.

  4. 4

    Predice nuevos valores

    Sustituye cualquier x en y = m·x + b para obtener la predicción del modelo.

Las fórmulas detrás del ajuste

Dado N puntos de datos (x_i, y_i), la pendiente y la intersección de mínimos cuadrados ordinarios son:

m = Σ((x_i − x̄)(y_i − ȳ)) / Σ((x_i − x̄)²)
b = ȳ − m · x̄

R², el coeficiente de determinación, es la parte de la varianza en y explicada por x:

R² = 1 − SS_res / SS_tot

donde SS_res es la suma de los residuos al cuadrado y SS_tot es la suma de las desviaciones al cuadrado de y respecto a su media. Pearson r es ±√R², llevando el signo de la pendiente.

Ejemplo trabajado

Cinco puntos de datos:

x y
1 2
2 4
3 5
4 4
5 6

x̄ = 3, ȳ = 4.2. Numerador de la covarianza = (1-3)(2-4.2) + (2-3)(4-4.2) + (3-3)(5-4.2) + (4-3)(4-4.2) + (5-3)(6-4.2) = 4.4 + 0.2 + 0 − 0.2 + 3.6 = 8.0. Numerador de la varianza de x = 4 + 1 + 0 + 1 + 4 = 10.

  • Pendiente m = 8.0 / 10 = 0.8
  • Intersección b = 4.2 − 0.8 × 3 = 1.8
  • Ecuación: y = 0.8x + 1.8
  • R² ≈ 0.727

Lo que los números hacen (y no) te dicen

  • Pendiente m responde “cuánto se mueve y por unidad de x”. Tiene las unidades de y/x.
  • Intersección b responde “cuál es y cuando x es 0”. Solo tiene sentido si x = 0 es plausible para tus datos.
  • mide la calidad del ajuste, no la causalidad. Un alto R² en datos proxy sin ruido puede seguir siendo irrelevante.
  • Pearson r captura la asociación lineal. r cerca de 0 con una fuerte relación curva aún significa “sin ajuste lineal”, no “sin relación”.

Peligros

  • Valores atípicos distorsionan fuertemente los ajustes de OLS porque la pérdida se eleva al cuadrado. Un punto rebelde puede rotar la línea 20 grados.
  • No linealidad no se detecta solo con R², siempre grafica los residuos contra x.
  • La regresión no es simétrica: ajustar y sobre x da una línea diferente que ajustar x sobre y.
  • Extrapolación más allá del rango de tus datos es especulación. El ajuste solo conoce el rango que vio.

Preguntas frecuentes

El 40% de la variación en y es explicada por la relación lineal con x. El 60% restante proviene del ruido, otras variables o no linealidad. En física eso es pobre; en datos sociales o económicos a menudo es aceptable.

Comienza con lineal. Si el gráfico de residuos muestra una curva clara, prueba una cuadrática o transformación logarítmica. Saltar directamente a un polinomio de alto grado sobreajusta y generaliza mal a nuevos datos.

Matemáticamente necesitas 2; significativamente, al menos 20. Por debajo de eso, un valor atípico domina el ajuste. Para resultados publicados, consulta la guía de tamaño de muestra específica para tu campo.

No. Los pares (x, y) que pegas se ajustan en tu navegador y nunca abandonan la página.

Herramientas relacionadas

Herramienta disponible en otros idiomas