ML Playground
RegresiónPrincipianteAprendizaje supervisado

Regresión lineal

Disponible

Ajusta una línea a un conjunto de puntos y observa cómo cambia el error cuadrático medio.

Descripción

Qué haceAprende una recta ŷ = m·x + b: dado un valor de x, usa la pendiente m y el intercepto b para predecir un valor numérico ŷ.

Para qué sirveEstimar una cantidad numérica (precio, temperatura, demanda) a partir de una sola variable, cuando la relación entre ambas es aproximadamente una línea recta.

Qué significa la mejor recta

Para cada punto, la recta produce una predicción. El algoritmo elige la pendiente y el intercepto que hacen pequeños los errores de todas esas predicciones.

Predicción

ŷᵢ = m·xᵢ + b

m indica cuánto cambia la predicción cuando x aumenta una unidad; b es la predicción cuando x = 0.

Error o residuo

eᵢ = ŷᵢ − yᵢ

Es la distancia vertical entre la predicción y el valor real. La regresión minimiza el promedio de sus cuadrados para que errores positivos y negativos no se cancelen.

Ejemplo con unidades:Para predecir el precio de un viaje en taxi, x puede ser la distancia en kilómetros y y el precio real en pesos. Si la recta aprendida es ŷ = 100x + 150, la pendiente es 100 pesos/km y el intercepto es un costo inicial de 150 pesos. Para un viaje de 4 km, predice 550 pesos; si el precio real fue 520 pesos, el residuo es 550 − 520 = 30 pesos.

Cómo aprende m y b

En regresión lineal simple con error cuadrático, los dos métodos buscan exactamente el mismo mínimo. La diferencia está en cómo llegan a él.

Solución cerrada

m = Σ(xᵢ−x̄)(yᵢ−ȳ) / Σ(xᵢ−x̄)²b = ȳ − m·x̄

Calcula el resultado directamente. El numerador mide si x e y varían juntas (covarianza); el denominador mide cuánto varía x. Es la opción natural para este problema pequeño y con una sola variable.

Descenso de gradiente

m ← m − α·(2/n)Σ eᵢxᵢb ← b − α·(2/n)Σ eᵢ

Empieza con m = 0 y b = 0. En cada iteración calcula hacia dónde aumenta el MSE y mueve ambos parámetros en sentido contrario. α es el learning rate: controla el tamaño de cada paso. Se usa cuando una solución directa no existe o resulta demasiado costosa, y aquí permite observar el aprendizaje paso a paso.

Cuándo se detiene:La demo para cuando la mejora del MSE entre dos pasos es menor que 0.0001 o al llegar a 100 iteraciones. Un learning rate demasiado grande puede saltar sobre el mínimo y hacer que el error crezca.

Caso límite:Si todos los puntos tienen la misma x, el denominador de la fórmula de m es cero y no existe una pendiente única. La demo lo indica y muestra como referencia la recta horizontal ŷ = ȳ.

Cómo se mide el resultado

Las dos métricas describen el ajuste desde perspectivas distintas: error en las unidades de y y mejora frente a una predicción básica.

MSE: tamaño del error

MSE = (1/n) Σ(yᵢ − ŷᵢ)²

Es el promedio de los residuos al cuadrado y es la cantidad que el algoritmo minimiza. Cero significa que todos los puntos caen sobre la recta; cuanto menor sea, mejor.

R²: mejora frente a la media

R² = 1 − Σ(yᵢ−ŷᵢ)² / Σ(yᵢ−ȳ)²

El numerador es el error de la recta (SSres) y el denominador es el error que habría al predecir siempre la media ȳ (SStot). Un valor de 1 es perfecto, 0 no mejora esa media y un valor negativo es peor que usarla.

En esta demo:MSE y R² se calculan sobre todos los puntos visibles. No miden todavía cómo funcionaría la recta con datos nuevos; para eso se necesita separar datos de entrenamiento y de test.

Playground

Entrenamiento

Dispersión de puntos con línea de ajuste-0.91.94.77.410.2-7.0-0.26.513.320.1xy
24 puntos. Línea de descenso de gradiente: pendiente 0.00, intercepto 0.00. Línea óptima (mínimos cuadrados): pendiente 1.87, intercepto -2.14.
  • Punto del dataset
  • Outlier
  • Descenso de gradiente (línea sólida)
  • Óptima / mínimos cuadrados (discontinua)

Métricas del modelo actual (descenso de gradiente)

Pendiente
0.00
Intercepto
0.00
MSE
65.09
-1.14
Iteración
0 / 100
Δ pendiente vs. óptima
1.87

Diferencia absoluta respecto a la solución cerrada (mínimos cuadrados).

Δ intercepto vs. óptima
2.14

Generación del dataset

Cambiar estos controles genera un dataset sintético nuevo y reinicia el descenso de gradiente.

Semilla del generador determinista.

24
860
1.5

Desviación estándar del ruido gaussiano añadido a y.

0.06.0

Editar puntos

Tabla editable de puntos del dataset: coordenadas x e y, con opción de eliminar cada punto.
xyAcciones

Atajo: Ctrl/Cmd+Z deshace la última edición confirmada (si el foco no está en un campo de texto).

Pérdida

Evolución de la pérdida (MSE) por iteración012340.018.436.855.273.5IteraciónMSE
Todavía no hay iteraciones registradas.

Descenso de gradiente

0.020
0.0010.050

Muy alto puede divergir (la pérdida crece); muy bajo converge lentamente.

Estado: Listo. El modelo parte con pendiente e intercepto iguales a cero.

Los controles de entrenamiento están disponibles. Atajo: barra espaciadora inicia o pausa (si el foco no está en un campo o control de texto).

Conceptos relacionados

Referencias