Métricas para modelos predictivos: MAE, RMSE, precision, recall, F1 y AUC
La métrica define qué significa “mejor”. Si eliges una métrica que no representa el coste real del error, puedes optimizar el modelo en la dirección equivocada.
Regresión: cuánto te equivocas
| Métrica | Qué resume | Útil cuando |
|---|---|---|
| MAE | Error absoluto medio | Quieres un error interpretable y robusto |
| RMSE | Penaliza más los errores grandes | Los fallos grandes son especialmente costosos |
| MAPE | Error porcentual | La escala relativa importa y no hay ceros problemáticos |
| R² | Varianza explicada respecto a una referencia | Quieres una medida complementaria, no única |
Clasificación: no todo es accuracy
Con clases desbalanceadas, una exactitud del 99% puede esconder un modelo inútil. Precision responde cuántos positivos predichos eran correctos; recall, cuántos positivos reales recuperaste. F1 equilibra ambas.
ROC-AUC y PR-AUC
ROC-AUC mide capacidad de ranking a distintos umbrales. Cuando la clase positiva es rara, la curva precision-recall y su área suelen describir mejor el comportamiento de interés.
Métricas de negocio
Un equipo con capacidad para revisar 500 casos necesita saber cuántos positivos encontrará entre los 500 primeros. Ahí entran precision@k, lift y gain. Traducir rendimiento técnico a capacidad operativa ayuda a decidir umbrales.
Evalúa por segmentos
Comprueba la métrica por mes, región, producto o grupo relevante. La media puede ocultar degradaciones. Además, guarda una línea base para detectar si el modelo deja de aportar ventaja.
No busques una métrica universal. Elige una métrica que refleje el tipo de error que tu organización puede asumir.
Ejemplo: por qué accuracy puede engañarte
Imagina 10.000 transacciones, de las que solo 100 son fraude. Un modelo que siempre diga “no fraude” obtiene 99% de accuracy y, sin embargo, no detecta ningún caso. Si el objetivo es recuperar fraude, recall pasa a ser crítico; si revisar una alerta cuesta mucho, precision también importa.
El umbral cambia el negocio
Muchos clasificadores producen una probabilidad. Convertir 0,73 en “positivo” requiere un umbral. Bajar el umbral suele aumentar recall y reducir precision; subirlo hace lo contrario. El punto adecuado depende de capacidad operativa, margen y coste de error.
Calibración
Si un modelo asigna 0,8 de probabilidad a cien casos, sería deseable que aproximadamente ochenta ocurran a largo plazo. Un ranking puede ser bueno y estar mal calibrado. Esto importa cuando la probabilidad se usa directamente para estimar riesgo o valor.
Buenas prácticas de reporting
- Publica siempre la línea base.
- Incluye intervalo temporal y tamaño de muestra.
- Muestra matriz de confusión en el umbral operativo.
- Segmenta por grupos relevantes.
- No redondees diferencias pequeñas como si fueran mejoras seguras.
¿Puedo optimizar varias métricas?
Sí, pero define una principal y usa las demás como restricciones o diagnóstico. Evita elegir el modelo después de mirar diez métricas distintas sin un criterio previo.
Si quieres conocer otros artículos parecidos a Métricas para modelos predictivos: MAE, RMSE, precision, recall, F1 y AUC puedes visitar la categoría Modelos Predictivos.
