Hay una versión de overfitting que no aparece en el conjunto de validación. Ocurre cuando el modelo captura patrones que existían en un período histórico pero que no persisten.

La trampa del backtesting optimista

Si ajustás hiperparámetros usando el período de prueba como referencia implícita, aunque no lo estés haciendo de forma explícita, el modelo aprende a funcionar bien en ese contexto específico. El resultado: métricas que convencen pero que colapsan en datos nuevos.

Esto es especialmente frecuente en datos financieros porque los regímenes de mercado cambian. Un modelo entrenado en un período de baja volatilidad puede tener métricas excelentes que no se trasladan a períodos distintos.

Tres señales concretas de que el modelo está sobreajustado

La diferencia entre la métrica de entrenamiento y la de validación es menor a lo esperado para el tamaño del dataset. El modelo pierde rendimiento abruptamente cuando se extiende el período de prueba por seis meses más. Las variables más importantes cambian significativamente al reentrenar con datos ligeramente distintos.

Cómo estructurar la validación para evitarlo

Walk-forward validation con ventanas de entrenamiento fijas, sin reoptimización de hiperparámetros en cada paso. Reservar el último año de datos como conjunto de prueba final, intocable hasta que el modelo esté completamente definido.

Un modelo que falla de forma predecible es más útil que uno que acierta por razones que no podés explicar.