Métricas para modelos predictivos: MAE, RMSE, precision, recall, F1 y AUC

La métrica define qué significa “mejor”. Si eliges una métrica que no representa el coste real del error, puedes optimizar el modelo en la dirección equivocada.

LucusHost, el mejor hosting
Índice
  1. Regresión: cuánto te equivocas
  2. Clasificación: no todo es accuracy
  3. ROC-AUC y PR-AUC
  4. Métricas de negocio
  5. Evalúa por segmentos
  6. Ejemplo: por qué accuracy puede engañarte
  7. El umbral cambia el negocio
  8. Calibración
  9. Buenas prácticas de reporting

Regresión: cuánto te equivocas

MétricaQué resumeÚtil cuando
MAEError absoluto medioQuieres un error interpretable y robusto
RMSEPenaliza más los errores grandesLos fallos grandes son especialmente costosos
MAPEError porcentualLa escala relativa importa y no hay ceros problemáticos
R²Varianza explicada respecto a una referenciaQuieres una medida complementaria, no única

Clasificación: no todo es accuracy

Con clases desbalanceadas, una exactitud del 99% puede esconder un modelo inútil. Precision responde cuántos positivos predichos eran correctos; recall, cuántos positivos reales recuperaste. F1 equilibra ambas.

ROC-AUC y PR-AUC

ROC-AUC mide capacidad de ranking a distintos umbrales. Cuando la clase positiva es rara, la curva precision-recall y su área suelen describir mejor el comportamiento de interés.

Métricas de negocio

Un equipo con capacidad para revisar 500 casos necesita saber cuántos positivos encontrará entre los 500 primeros. Ahí entran precision@k, lift y gain. Traducir rendimiento técnico a capacidad operativa ayuda a decidir umbrales.

Evalúa por segmentos

Comprueba la métrica por mes, región, producto o grupo relevante. La media puede ocultar degradaciones. Además, guarda una línea base para detectar si el modelo deja de aportar ventaja.

No busques una métrica universal. Elige una métrica que refleje el tipo de error que tu organización puede asumir.

Ejemplo: por qué accuracy puede engañarte

Imagina 10.000 transacciones, de las que solo 100 son fraude. Un modelo que siempre diga “no fraude” obtiene 99% de accuracy y, sin embargo, no detecta ningún caso. Si el objetivo es recuperar fraude, recall pasa a ser crítico; si revisar una alerta cuesta mucho, precision también importa.

El umbral cambia el negocio

Muchos clasificadores producen una probabilidad. Convertir 0,73 en “positivo” requiere un umbral. Bajar el umbral suele aumentar recall y reducir precision; subirlo hace lo contrario. El punto adecuado depende de capacidad operativa, margen y coste de error.

Calibración

Si un modelo asigna 0,8 de probabilidad a cien casos, sería deseable que aproximadamente ochenta ocurran a largo plazo. Un ranking puede ser bueno y estar mal calibrado. Esto importa cuando la probabilidad se usa directamente para estimar riesgo o valor.

Buenas prácticas de reporting

  • Publica siempre la línea base.
  • Incluye intervalo temporal y tamaño de muestra.
  • Muestra matriz de confusión en el umbral operativo.
  • Segmenta por grupos relevantes.
  • No redondees diferencias pequeñas como si fueran mejoras seguras.

¿Puedo optimizar varias métricas?

Sí, pero define una principal y usa las demás como restricciones o diagnóstico. Evita elegir el modelo después de mirar diez métricas distintas sin un criterio previo.

Si quieres conocer otros artículos parecidos a Métricas para modelos predictivos: MAE, RMSE, precision, recall, F1 y AUC puedes visitar la categoría Modelos Predictivos.

Subir