Regresión logística
DisponibleAjusta una frontera lineal que separa dos clases y observa cómo evoluciona la log-loss.
Descripción
Qué haceTraza una línea que separa dos clases y calcula, para cualquier punto, la probabilidad de pertenecer a cada lado de esa línea.
Para qué sirveClasificar en dos categorías (spam/no spam, aprueba/rechaza, clic/no clic) cuando además de la etiqueta interesa saber con cuánta confianza se predice.
Traza una frontera lineal que separa dos clases y predice la probabilidad de pertenecer a cada una. Dataset sintético, con semilla determinista.
De una recta a una probabilidad
Combinación lineal
z = w₁·x + w₂·y + b
La misma frontera que dibuja el playground cuando z = 0.
Sigmoide
σ(z) = 1 / (1 + e⁻ᶻ)
Comprime z a una probabilidad en (0, 1). En z = 0, σ(z) = 0.5.
Entrenamiento:Descenso de gradiente sobre la log-loss (entropía cruzada binaria); el gradiente tiene la misma forma que en regresión lineal: (predicción − real) · feature. Se detiene tras 500 iteraciones o mejora < 1e-7.
Cómo se mide el ajuste
Log-loss
-[y·log(p) + (1-y)·log(1-p)]
Penaliza con más fuerza una predicción confiada y equivocada. 0 es ajuste perfecto.
Accuracy, precisión, recall, F1
Con umbral 0.5 sobre la matriz de confusión de todo el dataset visible (detalle en fundamentos).
Frente a KNN y árbol de decisión
Asume separabilidad lineal
Sube la dispersión de las manchas: cuando se solapan, la log-loss se estanca en vez de bajar — a diferencia de KNN o el árbol, que trazan fronteras curvas.
Modelo compacto
Solo tres números (dos pesos, un intercepto): más barato de evaluar que guardar el dataset entero (KNN) o un árbol.
Sensible al escalado
Activa "Escalar features (z-score)" y compara iteraciones hasta converger con el mismo learning rate.
Datos casi separables
Sin regularizar, los pesos pueden crecer sin límite. La demo detiene el entrenamiento si dejan de ser finitos y lo marca como divergencia.
Playground
Entrenamiento
- Clase 0
- Clase 1
La línea sólida es la frontera de decisión (w·x + b = 0). Los puntos con un anillo rojo están mal clasificados con el modelo y el umbral actuales.
Métricas del modelo actual (descenso de gradiente)
- Peso x
- 0.000
- Peso y
- 0.000
- Intercepto
- 0.000
- Log-loss
- 0.6931
- Iteración
- 0 / 500
- Accuracy
- 50.0%
- Precisión
- 50.0%
- Recall
- 100.0%
- F1
- 66.7%
Umbral de decisión: 0.5. Verificación cruzada: 50.0%.
Generación del dataset
Dos manchas gaussianas (clase 0 y clase 1). Cambiar estos controles genera un dataset nuevo y reinicia el descenso de gradiente.
Semilla del generador determinista.
Desviación estándar de cada mancha. Baja: casi separable linealmente. Alta: clases solapadas.
Pérdida
Descenso de gradiente
Muy alto puede divergir (la pérdida crece o los pesos se vuelven no finitos); muy bajo converge lentamente.
Estado: Listo. El modelo parte con pesos e intercepto iguales a cero.
Los controles de entrenamiento están disponibles. Atajo: barra espaciadora inicia o pausa (si el foco no está en un campo o control de texto).