Árbol de decisión
DisponibleVisualiza cómo se divide el espacio de datos y cómo crece el árbol en paralelo.
Descripción
Qué haceClasifica haciendo una serie de preguntas simples de sí/no sobre los datos (¿esta variable es mayor que X?), como un diagrama de flujo aprendido automáticamente.
Para qué sirveCuando el modelo necesita ser interpretable — poder explicar la decisión como una secuencia de reglas legibles — y los datos tienen fronteras entre clases que no son líneas rectas.
Divide el espacio de features en rectángulos mediante preguntas del tipo ¿x ≤ umbral?. Dataset sintético.
Cómo crece el árbol
Impureza Gini
1 − Σ pᵢ²
Qué tan mezcladas están las clases de un nodo. 0 es puro; cerca de 1 es equilibrio total.
Ganancia
Impureza del padre menos el promedio ponderado de los hijos. Se elige el umbral con mayor ganancia, probando cada feature.
Recursión y hojas
Cada hijo repite el proceso. Un nodo se vuelve hoja al ser puro, llegar a la profundidad máxima, o quedarse sin puntos suficientes.
Ensamble (bagging)
La sección opcional combina varios árboles sobre muestras bootstrap, votando la clase mayoritaria entre todos.
Fuera de esta demo:La poda posterior a la construcción — recortar subárboles que no mejoran en validación — no está implementada; solo se controla el tamaño con maxDepth.
Qué muestra cada métrica
Predicción / profundidad usada
La clase de la hoja donde cae la consulta, y la profundidad real construida (puede ser menor que el máximo).
Hojas
El número de regiones rectangulares en las que quedó dividido el espacio.
No es generalización:La precisión de entrenamiento mide solo los puntos usados para construir el árbol — un árbol profundo puede memorizarlos y llegar al 100% sin decir nada sobre datos nuevos (ver fundamentos).
Ventajas y límites
Interpretable
Cada predicción se explica como una secuencia corta de preguntas, sin necesitar escalar features.
Overfitting
Sin límites, puede aislar cada punto en su propia hoja — ver caso «Profundidad excesiva».
Inestable
Un cambio pequeño en los datos puede cambiar toda la estructura — ver «Inestabilidad ante un cambio pequeño».
Fronteras en ángulo recto
Separar límites diagonales o circulares requiere muchas divisiones — ver «Círculos concéntricos».
Playground
- Clase 0
- Clase 1
- Clase 2
- Punto de consulta
Cada rectángulo es una hoja real del árbol, no una aproximación muestreada: sus bordes son exactamente las divisiones que CART eligió. La región que contiene al punto de consulta se resalta con un borde de acento.
Resultado de la clasificación
- Predicción
- Clase 0
- Profundidad usada
- 2 / 3
- Hojas
- 4
- Precisión de entrenamiento
- 100%
Puede ser menor que la profundidad máxima si el árbol ya separó todo antes.
Sobre los mismos puntos usados para construir el árbol: no mide generalización.
Estructura del árbol
Los nodos resaltados en acento son el camino que sigue el punto de consulta, de raíz a hoja.
y ≤ -0.98
Gini 0.667 · n = 120 · ganancia 0.321
Si y ≤ -0.98
x ≤ -3.14
Gini 0.048 · n = 41 · ganancia 0.048
Si x ≤ -3.14
Hoja · predicción: clase 0
Gini 0.000 · n = 1
- Clase 0: 1 (100%)
Si x > -3.14
Hoja · predicción: clase 2
Gini 0.000 · n = 40
- Clase 2: 40 (100%)
Si y > -0.98
x ≤ 0.47
Gini 0.500 · n = 79 · ganancia 0.500
Si x ≤ 0.47
Hoja · predicción: clase 0
Gini 0.000 · n = 39
- Clase 0: 39 (100%)
Si x > 0.47
Hoja · predicción: clase 1
Gini 0.000 · n = 40
- Clase 1: 40 (100%)
Generación del dataset
Cambiar estos controles genera un dataset sintético nuevo y reconstruye el árbol.
Semilla del generador determinista.
Desviación estándar del ruido gaussiano de cada grupo.
Hiperparámetros del árbol
Cuántos niveles de divisiones puede tener el árbol como máximo.
Un nodo con menos puntos que este mínimo se vuelve hoja aunque sea impuro.
Ensamble (bagging)
Construye varios árboles sobre muestras bootstrap del mismo dataset y combina sus predicciones por voto mayoritario.