ML Playground

Referencia

Glosario

Una entrada por cada concepto listado en «Conceptos relacionados» a través de las demos y la sección de fundamentos. Busca por término o filtra por contenido; cada término enlaza de vuelta al lugar donde aparece.

23 términos encontrados

centroides

Puntos que representan el centro de cada cluster en K-Means, calculados como la media de los puntos asignados a ese cluster; se recalculan en cada iteración.

coste de inferencia

Trabajo computacional que exige predecir sobre un punto nuevo. En KNN por fuerza bruta crece con el tamaño del dataset de entrenamiento, a diferencia de modelos que precalculan una regla fija en el entrenamiento.

descenso de gradiente

Algoritmo iterativo que ajusta los parámetros de un modelo dando pasos en la dirección que más reduce la función de pérdida, controlado por una tasa de aprendizaje.

distancia

Medida numérica de qué tan lejos están dos puntos en el espacio de features. KNN clasifica según la distancia (euclídea o Manhattan) a los puntos de entrenamiento más cercanos.

elección de k

Decidir cuántos clusters buscar en K-Means antes de correr el algoritmo — a diferencia de KNN, k aquí no tiene una respuesta correcta única y suele apoyarse en heurísticas como el método del codo.

entropía

Medida alternativa a Gini de la impureza de un nodo, basada en teoría de la información; ambas buscan el mismo tipo de split, con una fórmula distinta.

escalado de features

Transformar las features para que compartan una escala comparable (por ejemplo, estandarizando a media 0 y desviación 1) antes de medir distancias, para que ninguna domine el resultado solo por su unidad de medida.

función de pérdida

Función que mide qué tan lejos están las predicciones de un modelo de los valores reales; entrenar es, casi siempre, minimizarla. Regresión lineal usa el error cuadrático medio.

función sigmoide

Función que comprime cualquier número real al intervalo (0, 1), con forma de S: σ(z) = 1 / (1 + e⁻ᶻ). La regresión logística la usa para convertir una combinación lineal de features en una probabilidad.

Gini

Índice de impureza que mide qué tan mezcladas están las clases en un nodo de un árbol de decisión; CART elige en cada split la división que más reduce la impureza Gini ponderada.

inercia

Suma de las distancias al cuadrado de cada punto a su centroide asignado en K-Means; una medida de qué tan compactos son los clusters resultantes, usada para comparar corridas o elegir k.

inicialización

Elección de las posiciones iniciales de los centroides en K-Means, antes de la primera iteración. Una mala inicialización puede llevar a una convergencia en un óptimo local pobre.

log-loss

Entropía cruzada binaria: función de pérdida para clasificación que penaliza con más fuerza una predicción confiada y equivocada que una insegura y equivocada. La regresión logística la minimiza por descenso de gradiente.

métricas

Números que resumen el desempeño de un modelo de clasificación a partir de la matriz de confusión — accuracy, precision, recall, F1, entre otras — cada una sensible a un tipo distinto de error.

outliers

Puntos atípicos que se alejan mucho del resto del dataset. Pueden distorsionar un ajuste (como el de regresión lineal) mucho más de lo que su cantidad sugeriría.

overfitting

Cuando un modelo aprende el ruido y las particularidades del set de entrenamiento en vez del patrón general, y por eso generaliza mal a datos nuevos.

profundidad

Cantidad de niveles de un árbol de decisión desde la raíz hasta su hoja más lejana. Acotarla es una de las formas más simples de limitar el overfitting de un árbol.

regularización

Penalización añadida a una función de pérdida para desalentar modelos demasiado complejos y reducir overfitting, a costa de sesgo adicional.

similitud del coseno

Medida de similitud entre dos vectores basada en el ángulo entre ellos, no en su magnitud; TF-IDF la usa para comparar documentos representados como vectores de términos.

TF-IDF

Term Frequency–Inverse Document Frequency: pondera cada término por cuánto aparece en un documento (TF) frente a cuántos documentos lo contienen en la colección (IDF), para dar más peso a los términos distintivos.

tokenización

Dividir un texto en unidades más pequeñas (tokens, típicamente palabras) antes de procesarlo. El primer paso de TF-IDF sobre cualquier documento.

underfitting

Cuando un modelo es demasiado simple para capturar el patrón real de los datos, y por eso falla tanto en entrenamiento como en test — lo opuesto de overfitting.

validación cruzada

Técnica para estimar qué tan bien generaliza un modelo dividiendo los datos en varios subconjuntos y rotando cuál se usa como test, en vez de depender de una sola partición train/test.