ML Playground
ClasificaciónIntermedioAprendizaje supervisado

Regresión logística

Disponible

Ajusta una frontera lineal que separa dos clases y observa cómo evoluciona la log-loss.

Descripción

Qué haceTraza una línea que separa dos clases y calcula, para cualquier punto, la probabilidad de pertenecer a cada lado de esa línea.

Para qué sirveClasificar en dos categorías (spam/no spam, aprueba/rechaza, clic/no clic) cuando además de la etiqueta interesa saber con cuánta confianza se predice.

Traza una frontera lineal que separa dos clases y predice la probabilidad de pertenecer a cada una. Dataset sintético, con semilla determinista.

De una recta a una probabilidad

Combinación lineal

z = w₁·x + w₂·y + b

La misma frontera que dibuja el playground cuando z = 0.

Sigmoide

σ(z) = 1 / (1 + e⁻ᶻ)

Comprime z a una probabilidad en (0, 1). En z = 0, σ(z) = 0.5.

Entrenamiento:Descenso de gradiente sobre la log-loss (entropía cruzada binaria); el gradiente tiene la misma forma que en regresión lineal: (predicción − real) · feature. Se detiene tras 500 iteraciones o mejora < 1e-7.

Cómo se mide el ajuste

Log-loss

-[y·log(p) + (1-y)·log(1-p)]

Penaliza con más fuerza una predicción confiada y equivocada. 0 es ajuste perfecto.

Accuracy, precisión, recall, F1

Con umbral 0.5 sobre la matriz de confusión de todo el dataset visible (detalle en fundamentos).

Frente a KNN y árbol de decisión

Asume separabilidad lineal

Sube la dispersión de las manchas: cuando se solapan, la log-loss se estanca en vez de bajar — a diferencia de KNN o el árbol, que trazan fronteras curvas.

Modelo compacto

Solo tres números (dos pesos, un intercepto): más barato de evaluar que guardar el dataset entero (KNN) o un árbol.

Sensible al escalado

Activa "Escalar features (z-score)" y compara iteraciones hasta converger con el mismo learning rate.

Datos casi separables

Sin regularizar, los pesos pueden crecer sin límite. La demo detiene el entrenamiento si dejan de ser finitos y lo marca como divergencia.

Playground

Entrenamiento

Puntos de entrenamiento y frontera de decisión lineal-6.8-3.20.44.07.6-3.4-0.91.64.16.6xy
80 puntos de entrenamiento. El modelo todavía no define una frontera lineal (pesos en cero o degenerados).
  • Clase 0
  • Clase 1

La línea sólida es la frontera de decisión (w·x + b = 0). Los puntos con un anillo rojo están mal clasificados con el modelo y el umbral actuales.

Métricas del modelo actual (descenso de gradiente)

Peso x
0.000
Peso y
0.000
Intercepto
0.000
Log-loss
0.6931
Iteración
0 / 500
Accuracy
50.0%

Umbral de decisión: 0.5. Verificación cruzada: 50.0%.

Precisión
50.0%
Recall
100.0%
F1
66.7%

Generación del dataset

Dos manchas gaussianas (clase 0 y clase 1). Cambiar estos controles genera un dataset nuevo y reinicia el descenso de gradiente.

Semilla del generador determinista.

40
5120
1.4

Desviación estándar de cada mancha. Baja: casi separable linealmente. Alta: clases solapadas.

0.34.0

Pérdida

Evolución de la pérdida (log-loss) por iteración0.00.30.50.81.00.00.30.50.81.0IteraciónLog-loss
Todavía no hay iteraciones registradas.

Descenso de gradiente

0.100
0.0011.000

Muy alto puede divergir (la pérdida crece o los pesos se vuelven no finitos); muy bajo converge lentamente.

Estado: Listo. El modelo parte con pesos e intercepto iguales a cero.

Los controles de entrenamiento están disponibles. Atajo: barra espaciadora inicia o pausa (si el foco no está en un campo o control de texto).

Conceptos relacionados

Referencias