Como hacer backtest sin overfitting: guia completa

13 min de lectura
BacktestingOverfittingWalk-forwardOut-of-sampleValidacion

Un backtest sin overfitting exige reservar al menos el 30% de los datos históricos como out-of-sample, probados únicamente después de que todos los parámetros estén fijados. Sin esta separación estricta, tu estrategia se optimiza sobre sus propios datos de prueba: memoriza el pasado en lugar de comprenderlo. El resultado son curvas de equity perfectas en el backtesting que colapsan en los primeros 30 días de trading real. Esta guía presenta tres métodos validados por la investigación cuantitativa para distinguir una estrategia robusta de un artefacto estadístico.

¿Qué es el overfitting en trading?

Definición y mecanismo

El overfitting ocurre cuando una estrategia acumula parámetros ajustados a los datos de entrenamiento hasta encajar perfectamente con su ruido aleatorio. Cada parámetro adicional reduce el error medido en el backtesting, pero aumenta el error real en vivo, un fenómeno conocido como el tradeoff sesgo-varianza en estadística.

Considera una regla simple: "comprar cuando el RSI(14) cruce los 30". Depende de un único parámetro. Ahora prueba RSI(9), RSI(13), RSI(21) y RSI(26), con umbrales en 28, 29, 30, 31 y 32, más condiciones adicionales para cada combinación. Una de ellas producirá inevitablemente un Sharpe ratio de 2,8 en los últimos cinco años. Ese resultado no predice nada: describe un pasado específico con precisión ilusoria.

Curva de equity vs realidad del mercado

Una curva de equity perfecta con 0% de drawdown máximo durante tres años no existe en el trading real. Los mercados cambian de régimen: el entorno tendencial de 2020-2021 recompensó estrategias momentum que después fallaron en el mercado volátil y bajista de 2022. Una estrategia sin overfitting muestra un rendimiento degradado pero predecible fuera de los datos de entrenamiento, no un colapso total.

Según un análisis de la ESMA publicado en marzo de 2018, entre el 74% y el 89% de las cuentas de traders minoristas pierden dinero en CFDs, con pérdidas medias por cliente de entre 1.600 y 29.000 euros. Una parte significativa de estas pérdidas proviene de estrategias backtestadas de forma ingenua, sin protección contra el overfitting.

Un backtest perfecto es una señal de alerta

Cuanto más suave sea tu curva de equity y más altas sean tus métricas in-sample, más cautela es necesaria. Una estrategia robusta siempre muestra cierta degradación entre los períodos in-sample y out-of-sample: esa es la señal de que generaliza en lugar de memorizar.

Curve fitting vs robustez

El curve fitting es el overfitting llevado al extremo: la estrategia está tan finamente ajustada que ya no describe un comportamiento de mercado generalizable, sino una secuencia específica de accidentes históricos. Una estrategia robusta, por el contrario, mantiene un rendimiento consistente en diferentes períodos, activos y condiciones de mercado. La robustez se mide estadísticamente, no se adivina.

División in-sample / out-of-sample

Por qué dividir los datos

La separación in-sample / out-of-sample es la técnica más fundamental para detectar el overfitting antes de operar en el mercado real. Divide el historial de precios disponible en dos partes distintas: una se usa para construir y optimizar la estrategia (in-sample), la otra permanece intacta hasta la validación final (out-of-sample).

El conjunto out-of-sample se trata como un mercado futuro simulado. Si el rendimiento en este conjunto se degrada significativamente respecto al in-sample, el diagnóstico es claro: la estrategia fue demasiado ajustada y no generalizará con nuevos datos.

Para profundizar en este concepto, consulta nuestra guía completa sobre validación out-of-sample de estrategias.

¿Qué proporción usar: 70/30 o 80/20?

La literatura de finanzas cuantitativas, especialmente los trabajos de Robert Pardo en "The Evaluation and Optimization of Trading Strategies", recomienda reservar al menos el 30% de los datos históricos para la validación out-of-sample. En la práctica:

Proporción IS/OOSCaso de usoVentajaLimitación
80/20Pocos datos (< 3 años)Maximiza los datos de optimizaciónOut-of-sample demasiado corto
70/30Estándar recomendado (3-10 años)Equilibrio entre robustez y optimizaciónNinguna con datos suficientes
60/40Datos abundantes (10+ años)Out-of-sample muy robustoMenos datos para optimización

La proporción 70/30 es el estándar de la industria. Con menos de tres años de datos, cualquier backtesting se vuelve sospechoso independientemente del método de validación utilizado.

Implementación práctica

Concretamente, si estás haciendo backtesting durante cinco años (2019-2024):

  • In-sample: 2019 a 2022 (tres años y medio de construcción y optimización de parámetros)
  • Out-of-sample: 2022 a 2024 (un año y medio de validación, nunca tocado durante la optimización)

La regla absoluta: los parámetros finales deben fijarse ANTES de ver los resultados out-of-sample. Si ajustas un parámetro después de consultar los resultados OOS, ese conjunto OOS se convierte en in-sample disfrazado y pierde todo valor de validación.

Con Backtrex, esta separación está integrada directamente en el motor de backtesting visual: defines la frontera IS/OOS en la interfaz, y el motor impide cualquier optimización en el período reservado.

Walk-forward analysis: el método avanzado

El principio del walk-forward

La walk-forward analysis es una extensión dinámica del split IS/OOS. En lugar de una única división, repite el proceso de optimización y prueba en ventanas temporales deslizantes: optimiza en una ventana, prueba en la siguiente, avanza ambas en el tiempo y repite.

Este método resuelve el problema del split estático: una estrategia puede parecer válida en un único período OOS de 2022-2024, pero fallar bajo otros regímenes de mercado. El walk-forward obliga a la estrategia a demostrar su robustez en múltiples ciclos económicos y de volatilidad distintos.

Walk-forward vs backtesting estático

CriterioBacktest estático (split único)Walk-forward analysis
Resistencia al overfittingBaja a moderadaAlta
Detección de degradación temporalNoSí (por ventana deslizante)
Cobertura de regímenes de mercadoUn único régimen OOSMúltiples regímenes distintos
Complejidad de implementación manualBajaAlta sin herramienta dedicada
Confianza en el mercado realModeradaAlta

Implementación paso a paso

1

Definir la ventana de optimización (in-sample)

Elige una ventana fija para el in-sample: típicamente de 6 a 18 meses según la frecuencia de trading. Más corta para scalping intraday, más larga para swing trading.
2

Definir la ventana de validación (out-of-sample)

La ventana OOS sigue directamente después de la IS. Proporción recomendada: 25 a 30% de la ventana IS. Ejemplo: IS de 12 meses con OOS de 3 meses.
3

Optimizar en el in-sample

Encuentra los mejores parámetros en la ventana in-sample. No abras todavía los resultados OOS: cualquier consulta prematura invalida la separación.
4

Probar en el out-of-sample

Aplica los parámetros encontrados a la ventana OOS. Registra el rendimiento sin modificar los parámetros. Esto es un veredicto, no una nueva optimización.
5

Avanzar la ventana

Desplaza ambas ventanas hacia el futuro (un mes o un trimestre, según tu elección). Repite los pasos 3 y 4 hasta cubrir todo el historial disponible.
6

Concatenar los períodos OOS

El rendimiento total de la estrategia es la concatenación de todos los períodos OOS. Esa es la curva que representa fielmente el rendimiento real esperado en vivo.

Para más dimensiones de validación, consulta nuestro artículo sobre robustez en backtesting y stress tests.

Simulación Monte Carlo para la robustez

Cómo funciona la simulación

La simulación Monte Carlo aplica perturbaciones aleatorias a la secuencia de trades históricos para generar miles de escenarios alternativos. Responde a la pregunta central: "Si el orden de los trades hubiera sido diferente, ¿cuál sería la peor curva de equity posible?"

El método reordena aleatoriamente los trades de tu backtesting, recalcula las métricas en cada permutación y construye una distribución estadística de todos los resultados posibles. De mil a diez mil simulaciones es el estándar habitual.

Nuestra guía dedicada a la simulación Monte Carlo en trading detalla los pasos de implementación e interpretación de los resultados.

Monte Carlo y split OOS: dos validaciones complementarias

El split OOS valida la estrategia en una secuencia temporal específica. El Monte Carlo valida si los resultados dependen del orden específico de los trades o si reflejan una edge genuina. Los dos enfoques se complementan y no son sustituibles entre sí.

Interpretando los resultados

Después de mil simulaciones, obtienes una distribución de drawdowns máximos y Sharpe ratios. Las métricas clave para analizar:

  • Drawdown máximo en el percentil 95: el peor drawdown probable en el 95% de los escenarios simulados. Si esta cifra supera tu umbral de tolerancia, la estrategia es demasiado arriesgada.
  • Profit factor mediano: el valor central de la distribución, más representativo que el valor del backtesting original.
  • Probabilidad de ruina: la proporción de simulaciones en las que el capital cae por debajo de un umbral crítico (por ejemplo, menos 50%).

Umbrales de confianza aceptables

Una estrategia pasa el filtro Monte Carlo si cumple tres criterios:

  • El drawdown en el percentil 95 se mantiene manejable en relación con el capital asignado a la estrategia
  • Menos del 5% de las simulaciones alcanzan el umbral de ruina definido
  • El Sharpe ratio mediano simulado es superior a 1,0

Si la distribución de resultados es muy amplia (alta desviación estándar), la estrategia es intrínsecamente inestable. Incluso un backtesting original excelente no compensa una varianza excesiva en los escenarios simulados.

Checklist anti-overfitting antes de operar en vivo

Número de parámetros vs períodos probados

La regla empírica en finanzas cuantitativas: cada parámetro libre debe justificarse con al menos 30 trades en los datos históricos. Con cinco parámetros libres, se necesitan un mínimo de 150 trades. Con diez parámetros, un mínimo de 300.

Cuantos más grados de libertad en la optimización, mayor el riesgo de overfitting. Una estrategia bien validada con dos o tres parámetros siempre es preferible a una estrategia aparentemente perfecta con quince parámetros.

Pruebas en activos no vistos

Después de la validación en los activos de entrenamiento, prueba la estrategia en activos similares no utilizados durante la optimización. Una estrategia en EUR/USD debería también funcionar correctamente en GBP/USD y AUD/USD si captura una edge de mercado genuina, y no una particularidad de ese par específico.

Si el rendimiento colapsa al cambiar de activo, la estrategia es específica a ese mercado en ese período concreto: esa es la definición de overfitting.

Señales de alerta a vigilar

Señales tipicas de overfitting

Sé especialmente vigilante si tu backtesting muestra: Sharpe ratio superior a 3 durante cinco años, drawdown máximo inferior al 5%, más de diez parámetros optimizados, rendimiento que mejora sistemáticamente cada vez que se añade una condición, o una degradación superior al 50% entre los resultados in-sample y out-of-sample.

Para un análisis completo de los sesgos que distorsionan los backtests, consulta nuestra guía sobre los errores más comunes de backtesting y la comparación entre backtest y forward testing.

Una referencia académica fundamental sobre este tema: Bailey, Borwein, Lopez de Prado y Zhu demostraron en su artículo "Pseudo-mathematics and Financial Charlatanism" que la tasa de falsos descubrimientos de estrategias rentables aumenta exponencialmente con el número de backtests realizados en los mismos datos históricos.

Important Risk Warning

Trading financial instruments involves significant risk of capital loss. Past performance does not guarantee future results. Backtest results presented on this platform are based on historical data and do not constitute investment advice. You should not invest money you cannot afford to lose. Always consult a qualified financial advisor before making any investment decisions.

Conclusión

Hacer backtesting sin overfitting no es una restricción adicional: es la única forma de saber si tu estrategia tiene una edge genuina o simplemente está memorizando el pasado. Los tres métodos presentados (split IS/OOS, walk-forward analysis, Monte Carlo) son complementarios y juntos forman un proceso de validación riguroso que hedge funds y traders cuantitativos utilizan desde hace décadas.

Backtrex integra de forma nativa la separación in-sample/out-of-sample en su motor de backtesting visual no-code, haciendo esta validación accesible a cualquier trader sin conocimientos de programación. Consulta los precios y valida tus estrategias con los mismos estándares que los profesionales.

El overfitting en backtesting ocurre cuando una estrategia de trading se ajusta demasiado a los datos históricos utilizados para construirla. Obtiene excelentes resultados en esos datos específicos, pero falla con cualquier nuevo flujo de mercado, porque ha memorizado ruido aleatorio en lugar de una estructura de mercado genuinamente recurrente. El resultado típico es una curva de equity perfecta en backtesting que colapsa en las primeras semanas de operación real.

Para evitar el curve fitting: limita el número de parámetros libres (idealmente de tres a cinco como máximo), reserva estrictamente el 30% de los datos históricos como out-of-sample antes de cualquier optimización, usa walk-forward analysis en múltiples ventanas temporales deslizantes y valida la estrategia en activos no utilizados durante el entrenamiento. Un parámetro solo debería añadirse si mejora la lógica de la estrategia, no solo las métricas del backtesting.

Un backtesting fiable requiere al menos tres años de datos históricos, e idealmente de cinco a diez años cubriendo diferentes regímenes de mercado: mercado alcista, mercado bajista, mercado lateral y períodos de alta y baja volatilidad. Menos de tres años supone un alto riesgo de optimizar en un único régimen de mercado, lo que sesga fuertemente los resultados hacia el overfitting.

El estándar de la industria, derivado de los trabajos de Robert Pardo sobre evaluación de estrategias de trading, es una proporción del 70% in-sample para el 30% out-of-sample. Con datos limitados (menos de tres años), una proporción 80/20 es aceptable pero menos robusta. Con más de diez años de datos, una proporción 60/40 refuerza la confianza en los resultados.

La walk-forward analysis es una técnica avanzada de validación que repite el proceso de optimización y prueba en ventanas temporales deslizantes. A diferencia del split estático IS/OOS, evalúa la estrategia en múltiples períodos distintos, revelando si la robustez se mantiene en diferentes regímenes de mercado. Produce una curva de equity compuesta íntegramente de períodos out-of-sample sucesivos, más representativa del comportamiento real esperado.

La simulación Monte Carlo reordena aleatoriamente los trades de tu backtesting en miles de permutaciones para generar una distribución estadística de resultados posibles. Evalúa si las métricas del backtesting original dependen del orden específico de los trades (señal de inestabilidad) o son robustas independientemente de la secuencia. Una estrategia pasa este filtro si el drawdown en el percentil 95 se mantiene manejable y menos del 5% de las simulaciones llevan al umbral de ruina definido.

La regla empírica de las finanzas cuantitativas recomienda al menos 30 trades por parámetro libre en la estrategia. Una estrategia con tres parámetros debe generar un mínimo de 90 trades en el historial. Por debajo de este umbral, los resultados carecen de significación estadística y el overfitting se vuelve muy difícil de detectar, incluso con los métodos de validación más rigurosos.

Lecturas Recomendadas

¿Listo para probar tus estrategias?

Únete a la lista de espera y sé el primero en crear, probar y validar estrategias de trading, sin escribir código.

Crea tu cuenta gratuita en 30 segundos. Sin tarjeta de crédito.