La Probability of Backtest Overfitting (PBO) de David Bailey es la única métrica estadística que cuantifica el riesgo exacto de overfitting en un backtest. Propuesta en 2014 por Bailey y Marcos Lopez de Prado en el Journal of Computational Finance, esta fórmula ofrece un número entre 0 y 1 que representa la probabilidad de que tu estrategia optimizada sea producto del azar y no de un verdadero edge de mercado. Comprender y aplicar el PBO se ha vuelto indispensable antes de operar en cuenta real o enviar una estrategia a una prop firm como FTMO o MyFundedFX.
El problema del overfitting medido por Bailey
El overfitting es la principal causa de fracaso de las estrategias de trading en condiciones reales. Un backtest espectacular puede simplemente reflejar adaptación a datos pasados en lugar de un verdadero edge. Antes del trabajo de Bailey, ninguna fórmula permitía cuantificar este riesgo con precisión.
Contexto: la investigación de 2014
En 2014, David Bailey, Jonathan Borwein, Marcos Lopez de Prado y Qiji Zhu publicaron "Pseudo-mathematics and Financial Charlatanism" en los Notices of the American Mathematical Society. Este estudio demostró que, con solo 45 parámetros libres probados secuencialmente, se vuelve casi seguro encontrar una combinación que produzca un Sharpe Ratio superior a 1 con datos completamente aleatorios. En otras palabras, la mayoría de las estrategias "buenas" son simplemente el resultado de explorar sistemáticamente el espacio de parámetros, no de un verdadero edge de mercado.
Fuente: Bailey et al. (2014), Notices of the AMS
Ese mismo año, Bailey y Lopez de Prado formalizaron el cálculo del PBO mediante un método de validación cruzada combinatoria, publicado en el Journal of Computational Finance.
La fórmula PBO (Probability of Backtest Overfitting)
El PBO se define como la probabilidad de que la mejor estrategia seleccionada en datos in-sample tenga un rendimiento inferior a la mediana de las estrategias en datos out-of-sample:
PBO = P(SBO menor que 0)
El SBO (Stochastic Backtest Optimization) es el logaritmo de la razón entre el rendimiento out-of-sample de la mejor estrategia in-sample y la mediana de todas las N estrategias. Un SBO negativo significa que la estrategia ganadora en backtest queda por debajo de la mediana en datos no vistos: señal clara de overfitting.
¿Por qué medir respecto a la mediana?
Bailey usa la mediana (no el rendimiento absoluto) para controlar el sesgo de selección. Si la mejor estrategia in-sample no supera a la mitad de las otras estrategias out-of-sample, es porque fue optimizada para el ruido histórico, no para la estructura real del mercado.
Cómo calcular el PBO
El cálculo del PBO se basa en la validación cruzada combinatoria (CPCV). Aquí está el proceso paso a paso.
Método de validación cruzada combinatoria
A diferencia de la k-fold cross-validation clásica, el método de Bailey prueba todas las combinaciones posibles de particiones in-sample y out-of-sample. Para S = 6 sub-períodos, esto genera C(6,3) = 20 combinaciones, ofreciendo una estimación estadísticamente robusta del riesgo de overfitting.
Dividir los datos en S sub-períodos
Generar todas las combinaciones
Evaluar el rendimiento out-of-sample
Calcular el SBO por combinación
Estimar el PBO final
Fuente del método: Bailey y Lopez de Prado (2014), preprint SSRN
Interpretación del resultado (0 a 1)
| Valor PBO | Interpretación | Acción recomendada |
|---|---|---|
| PBO inferior a 0,1 | Estrategia muy robusta, riesgo de overfitting mínimo | Pasar a forward testing en cuenta demo |
| 0,1 a 0,3 | Riesgo bajo, robustez aceptable | Validar con walk-forward antes de cuenta real |
| 0,3 a 0,5 | Riesgo moderado, sobreoptimización parcial probable | Reducir el número de parámetros libres |
| PBO superior a 0,5 | Overfitting probable según Bailey | No operar en cuenta real en este estado |
| PBO superior a 0,8 | Overfitting casi seguro | Rechazar la estrategia y comenzar de nuevo |
Umbrales prácticos para traders
Bailey recomienda PBO = 0,5 como umbral de decisión. Para estrategias destinadas a prop firms (FTMO, MyFundedFX, The5ers), los gestores cuantitativos profesionales apuntan a un PBO inferior a 0,1, aunque este estándar aún no es exigido explícitamente por las prop firms.
El PBO es necesario pero no suficiente
Un PBO bajo valida la robustez estadística en datos históricos, pero no garantiza el rendimiento futuro. Las condiciones del mercado cambian. Combinar PBO y walk-forward optimization es la mejor práctica para una validación completa.
Aplicando Bailey a tus estrategias
Cuántos backtests son necesarios para interpretar el PBO
Cuantas más configuraciones de estrategias pruebes sobre los mismos datos, más alto subirá el PBO mecánicamente. Bailey demuestra que el PBO depende directamente de N, el número de estrategias candidatas probadas. Con N = 50 configuraciones probadas en el mismo período histórico, se espera un PBO de 0,5 o más incluso si la configuración "ganadora" parece robusta.
La regla práctica: limita el número de combinaciones probadas. Si exploraste 100 variantes para encontrar tus parámetros óptimos, tu PBO será alto independientemente del rendimiento in-sample. Si tu estrategia fue construida con 3 a 5 parámetros y probada en menos de 20 configuraciones, el PBO sigue siendo interpretable.
El papel del número de parámetros libres
El número de parámetros libres es el principal factor de overfitting. Cada parámetro añadido (período de media móvil, nivel de stop-loss, filtro de volatilidad) multiplica las configuraciones posibles y aumenta el riesgo de que la configuración óptima esté ajustada al ruido histórico en lugar de la lógica de mercado.
Regla de Bailey: 2k combinaciones para k parámetros binarios
Con k parámetros que pueden activarse o desactivarse, el número de configuraciones es 2 elevado a k. Para k = 10 parámetros binarios, eso da 1.024 configuraciones: el PBO casi seguramente superará 0,5 si eliges la mejor. Define la lógica de mercado primero, luego optimiza solo 1 a 2 parámetros.
Combinando PBO y walk-forward
La combinación de PBO y walk-forward optimization es el método de validación más riguroso disponible para traders retail. El PBO valida la robustez estadística global en todas las particiones posibles de los datos. El walk-forward valida la estabilidad de los parámetros en ventanas temporales sucesivas reales.
La secuencia recomendada antes de operar en cuenta real:
Para profundizar en el método walk-forward, consulta nuestra guía walk-forward optimization y validación de backtest.
Herramientas para calcular el PBO
Soluciones Python open-source
La biblioteca mlfinlab (Machine Learning Financial Laboratory) de Marcos Lopez de Prado implementa la CPCV directamente. Para cálculo manual, itertools.combinations en Python genera todos los pares de sub-períodos, y numpy calcula los rendimientos relativos. La curva de aprendizaje es pronunciada, pero el método está completamente documentado en los artículos originales de Bailey.
Plataformas con PBO integrado
La gran mayoría de las plataformas de backtesting retail (TradingView, MetaTrader 5) no calculan el PBO de forma nativa. Las herramientas cuantitativas profesionales requieren habilidades de programación, lo que representa una barrera real para traders no-code.
Backtrex y validación multi-período
Backtrex aborda el problema del overfitting mediante la validación multi-período automática. Al probar tu estrategia en múltiples ventanas temporales distintas (in-sample para configuración, luego validación out-of-sample automática en varios períodos), Backtrex genera indicadores de consistencia en el espíritu del método Bailey: una estrategia sólida debe rendir de forma consistente en los períodos no vistos, no solo en la ventana de optimización.
Backtrex es accesible con una cuenta gratuita que incluye un recorrido guiado, luego una licencia vitalícia Pro o Max con pago único, con 14 días para cambiar de opinión. Descubre nuestras funcionalidades de backtesting para saber más.
Para profundizar en los métodos de robustez, lee nuestra guía stress test y robustez de estrategias de trading o nuestro artículo sobre señales de alerta de overfitting en backtest.
Important Risk Warning
Conclusión
La fórmula PBO de David Bailey es la herramienta estadística más rigurosa disponible para evaluar si un backtest refleja un verdadero edge o simplemente adaptación a datos pasados. Con un PBO inferior a 0,1, una estrategia supera el test de robustez más exigente del campo. Combinar este cálculo con walk-forward y la validación multi-período de Backtrex es el estándar que separa a los traders serios de los que buscan el backtest perfecto.
El PBO es una métrica estadística desarrollada por David Bailey y Marcos Lopez de Prado en 2014. Mide la probabilidad de que una estrategia seleccionada por su rendimiento in-sample obtenga resultados inferiores a la mediana en datos out-of-sample. El cálculo usa validación cruzada combinatoria en todas las particiones posibles de los datos históricos. Un PBO de 0 indica riesgo nulo de overfitting; un PBO de 1 indica certeza de overfitting.
Bailey sugiere que un PBO superior a 0,5 indica overfitting probable: la estrategia es estadísticamente más propensa a ser fruto del azar que a representar un verdadero edge. Un PBO inferior a 0,1 se considera una señal sólida de robustez. Entre 0,1 y 0,5, se recomienda validación complementaria mediante walk-forward optimization antes de operar en cuenta real.
Sin habilidades de programación, es difícil calcular el PBO exacto. Sin embargo, puedes aplicar el espíritu del método Bailey probando tu estrategia en múltiples ventanas temporales distintas: un período in-sample para optimización, luego varios períodos out-of-sample sucesivos para validación. Si el rendimiento cae significativamente en los períodos no vistos, el overfitting es probable. Backtrex ofrece validación multi-período automática sin necesidad de código.
Sí, el PBO es fundamentalmente diferente del Sharpe Ratio out-of-sample. El Sharpe mide el rendimiento ajustado al riesgo en un período dado. El PBO mide la probabilidad de que la selección de la mejor estrategia in-sample sea fruto del azar estadístico, probando todas las configuraciones posibles de validación cruzada. Un Sharpe out-of-sample positivo es necesario pero no suficiente: el PBO evalúa si ese resultado es estadísticamente robusto en todas las particiones posibles de los datos.
Para mantener el PBO por debajo de 0,3, la regla empírica es probar menos de 20 configuraciones de parámetros en total. Con 5 parámetros binarios, ya tienes 32 configuraciones posibles. La recomendación de Bailey: define las reglas de la estrategia basándote en la lógica de mercado primero, luego optimiza solo 1 a 2 parámetros con pocos valores discretos posibles.
Sí, el PBO se aplica a cualquier estrategia de trading, incluidos los enfoques Smart Money Concepts (SMC) e ICT. Estas estrategias suelen contener muchos parámetros implícitos (nivel de order block, tamaño del fair value gap, filtros de sesión horaria) que aumentan el riesgo de overfitting. Calcular el PBO en una estrategia SMC con backtest de varios años ayuda a distinguir un verdadero edge de una configuración sobreajustada a los datos históricos.
El PBO es una medida estadística global de la probabilidad de overfitting, calculada mediante validación cruzada combinatoria en todos los datos disponibles. El walk-forward es un método de validación secuencial que prueba la estrategia en períodos futuros no vistos, uno tras otro. Ambos son complementarios: el PBO da una señal probabilística global, el walk-forward valida la estabilidad temporal de los parámetros. Usar ambos juntos constituye el método de validación más riguroso disponible para traders retail.