Cómo evaluar un backtest de bot cripto: win rate, drawdown, Sharpe

12 min de lectura
BacktestingCriptoBot-tradingMetricasProfit-factor

Un backtest de bot cripto sólo es válido si incluye más de 100 trades, comisiones realistas de exchange, ausencia de look-ahead bias y validación out-of-sample cubriendo al menos el 20% del período total. Sin estas condiciones, incluso una curva de capital perfecta oculta un sesgo de supervivencia o un overfitting que sólo se revelará cuando operes en tiempo real.

Las plataformas de bots populares publican backtests con rendimientos mensuales de tres dígitos. Antes de confiar tu capital a un algoritmo, necesitas saber leer esos resultados con mirada crítica. Esta guía te da las cinco métricas esenciales y las señales de alerta que diferencian un backtest serio de un ejercicio de marketing.

Por qué los backtests de bots cripto suelen ser engañosos

La mayoría de los backtests publicados por vendedores de bots omiten, de forma deliberada o por descuido, los factores que destruyen el rendimiento cuando la estrategia opera en el mercado real.

Look-ahead bias e indicadores con repainting

El look-ahead bias ocurre cuando el bot utiliza datos que no estaban disponibles en el momento de tomar la decisión de trade. Un ejemplo común: una estrategia que compra en el cierre de la vela actual (close[0]), aunque ese valor sólo se confirma en la apertura de la siguiente vela. En Backtrex, todas las estrategias se construyen con close[1] (la vela anterior confirmada) para eliminar este sesgo de forma automática. Esta es la garantía anti-repainting, y explica por qué los backtests de Backtrex replican los resultados del trading en vivo.

Un problema relacionado: indicadores RSI o medias móviles cuyos valores se recalculan retroactivamente durante el backtest. El resultado parece una estrategia perfecta, pero esa señal nunca podría haberse generado en tiempo real.

El problema del sesgo de supervivencia en cripto

El sesgo de supervivencia implica testear una estrategia sólo sobre activos que existen hoy, ignorando los que colapsaron o fueron eliminados de los exchanges. En cripto, este sesgo es severo: cientos de tokens populares en 2021 perdieron el 95% o más de su valor, y muchos desaparecieron completamente de las plataformas. Una estrategia testeada sólo sobre BTC y ETH actuales para el período 2019-2024 supera mecánicamente los benchmarks porque evita todos los activos que no sobrevivieron.

Cuidado con el sesgo de supervivencia en altcoins

Siempre testea una estrategia cripto sobre el conjunto completo de activos disponibles durante el período de prueba, no sólo sobre los que han llegado hasta hoy. Para estrategias sólo en BTC y ETH, este sesgo es limitado. Para altcoins, se vuelve crítico y puede hacer que una estrategia perdedora parezca ganadora.

Slippage y comisiones de exchange sistemáticamente excluidos

La mayoría de los backtests de bots ignoran el slippage (diferencia entre el precio teórico y el precio real de ejecución) y las comisiones de exchange. En Binance, la comisión estándar de maker es 0,1% y la de taker es 0,1% según el calendario oficial de tarifas de Binance. Para un bot de scalping que realiza 10 trades al día, eso representa aproximadamente un 2% de fricción diaria sobre el capital desplegado, lo que elimina la mayoría de las estrategias con un edge matemático reducido.

Las 5 métricas clave para evaluar un backtest de bot cripto

MétricaUmbral aceptableUmbral excelente
Profit factor> 1,5> 2,0
Sharpe ratio> 1,0> 2,0
Drawdown máximo< 20%< 10%
Win rate (con RR)Depende de la relación RRDepende de la relación RR
Número de trades> 100> 300

Win rate: por qué el 60% puede ser peor que el 40%

El win rate sólo no significa nada. Un bot con 60% de trades ganadores y una relación ganancia/pérdida de 0,5:1 pierde dinero a largo plazo. El valor esperado es negativo: 0,6 x 0,5 - 0,4 x 1 = -0,1. En cambio, un bot con 40% de trades ganadores y relación 3:1 tiene valor esperado positivo: 0,4 x 3 - 0,6 x 1 = +0,6. El número que importa es el profit factor, no el win rate.

Profit factor: el ratio más importante

El profit factor es la relación entre las ganancias brutas totales y las pérdidas brutas totales. Un profit factor de 1,0 significa que la estrategia está en equilibrio. Las estrategias algorítmicas viables generalmente muestran un profit factor superior a 1,5. Para un análisis completo de los ratios de rendimiento, consulta nuestro artículo sobre ratios de backtest: Sharpe, Sortino y Calmar.

Drawdown máximo: dimensionando posiciones en torno al riesgo real

El drawdown máximo mide la mayor caída desde el máximo histórico hasta el mínimo siguiente en la curva de capital del portafolio. Es el verdadero indicador de lo que experimentas como trader. Si tu bot muestra un drawdown del 40% en backtest, significa que en algún momento habrías tenido una pérdida del 40% desde el máximo de tu portafolio, algo psicológicamente insostenible para la mayoría de los operadores.

Regla de dimensionamiento de posición

Un drawdown máximo superior al 25% en backtest generalmente indica que la estrategia es demasiado agresiva para desplegar capital significativo. Reduce los tamaños de posición hasta que el drawdown teórico quede por debajo del 15 al 20%.

Sharpe y Sortino: ajustando el rendimiento al riesgo asumido

El Sharpe ratio mide el retorno en exceso en relación con la volatilidad total. Según los estándares de gestión de portafolios documentados por el CFA Institute, un Sharpe ratio superior a 1,0 se considera aceptable y superior a 2,0 es excelente para una estrategia algorítmica.

El Sortino ratio es una versión mejorada que sólo penaliza la volatilidad negativa (las pérdidas), sin penalizar los picos de ganancias. Para bots agresivos con grandes operaciones ganadoras eventuales, el Sortino proporciona una imagen más precisa del riesgo real asumido.

Número de trades: el umbral de significancia estadística

Un backtest basado en 20 trades no tiene ningún valor estadístico. La varianza natural de una muestra tan pequeña puede producir resultados favorables por puro azar. El consenso en la comunidad cuantitativa es que se necesitan un mínimo de 100 trades para alcanzar una significancia estadística básica. Por debajo de ese umbral, el margen de error es demasiado grande para distinguir un edge real de una racha aleatoria favorable. Para alta confianza, apunta a 300 o más trades en el período de prueba.

Señales de alerta de un backtest falso o con overfitting

Una curva de capital perfecta

Una equity curve perfectamente suave sin drawdown significativo es casi siempre señal de overfitting. Los mercados cripto son caóticos y no estacionarios: una estrategia genuinamente robusta inevitablemente pasará por períodos de pérdidas consecutivas. Busca una curva con caídas naturales, no una línea ascendente sin interrupciones. Nuestro artículo sobre cómo evitar el overfitting en backtesting profundiza en esto con ejemplos concretos.

Testeado sólo en mercados alcistas

Muchos bots fueron testeados exclusivamente durante el período 2020-2021, un mercado cripto alcista excepcional. Su rendimiento colapsa en cuanto el mercado entra en consolidación o caída. Exige un backtest que cubra al menos un ciclo completo: fuerte subida, consolidación lateral y bajada prolongada.

Parámetros ajustados para encajar en los datos históricos

Si los parámetros de una estrategia parecen sospechosamente precisos (RSI período 14,3, stop-loss al 2,73%), probablemente fueron optimizados específicamente para encajar en los datos del backtest. Este fenómeno, llamado curve-fitting o overfitting, garantiza buena performance en datos pasados pero mala performance en datos nuevos. Nuestro artículo sobre backtesting vs forward testing explica cómo validar una estrategia en datos no vistos.

La trampa del curve-fitting

Cuando una estrategia tiene más de cinco parámetros ajustables, la probabilidad de overfitting aumenta drásticamente. Prefiere reglas basadas en lógica de estructura de mercado a valores numéricamente optimizados sin racional subyacente.

Cómo realizar tu propio backtest de bot cripto

Configurando condiciones realistas

Antes de ejecutar un backtest, configura estos elementos fundamentales:

1

Incluir las comisiones de exchange

Agrega las comisiones de maker/taker de tu exchange (0,1% en Binance estándar, más altas en algunas plataformas para cuentas más pequeñas). Las comisiones se acumulan en cada trade abierto y cerrado.
2

Configurar el slippage estimado

Estima un slippage de 0,05 a 0,15% según la liquidez del par. Los pares de baja liquidez pueden tener slippage de 0,5% o más en condiciones normales de mercado.
3

Reservar un período out-of-sample

Reserva al menos el 20% de tus datos históricos para la validación final. Nunca optimices parámetros en este período reservado.
4

Testear en múltiples regímenes de mercado

Incluye períodos de fuerte subida, consolidación lateral y bajada para verificar que la estrategia se sostiene en diferentes condiciones.
5

Apuntar a un mínimo de 100 trades

Con menos de 100 trades, los resultados no tienen valor estadístico suficiente. Si la estrategia no genera trades suficientes en el período elegido, amplía la ventana temporal.

Usando Backtrex para backtesting sistemático

Backtrex permite construir estrategias con bloques visuales de drag-and-drop y ejecutar backtests en menos de 30 segundos sobre 5 a 10 años de datos históricos. Cada backtest aplica automáticamente close[1] para prevenir el look-ahead bias, comisiones y slippage configurables, y un informe completo con profit factor, drawdown, Sharpe ratio y estadísticas por trade.

El modelo de precios de Backtrex es sencillo: cuenta y visita guiada gratuitas, después licencia vitalicia Pro o Max en pago único, con 14 días para cambiar de opinión. Consulta las opciones en nuestra página de pricing.

Comparando resultados in-sample y out-of-sample

Comparar el rendimiento in-sample (período de optimización) con el rendimiento out-of-sample (período de validación) es la prueba definitiva de robustez. Si ambos resultados son próximos (profit factor de 1,8 in-sample y 1,6 out-of-sample), la estrategia probablemente es robusta y generalizable. Si el rendimiento OOS colapsa (profit factor de 1,8 IS y 0,9 OOS), la estrategia tiene overfitting sobre datos pasados y no se sostendrá en el futuro.

Una guía detallada sobre este método: backtesting vs forward testing: cómo validar una estrategia.

Important Risk Warning

Trading financial instruments involves significant risk of capital loss. Past performance does not guarantee future results. Backtest results presented on this platform are based on historical data and do not constitute investment advice. You should not invest money you cannot afford to lose. Always consult a qualified financial advisor before making any investment decisions.

Conclusión

Evaluar un backtest de bot cripto va mucho más allá de mirar el rendimiento anualizado. Las métricas que importan son: profit factor (objetivo superior a 1,5), Sharpe ratio (objetivo superior a 1,0), drawdown máximo (objetivo inferior al 20%) y número de trades (mínimo de 100 para significancia estadística básica). Un backtest sin comisiones realistas, sin validación out-of-sample y sin protección contra el look-ahead bias no es una base confiable para decisiones de despliegue de capital.

Las cuatro métricas esenciales son profit factor (objetivo superior a 1,5), Sharpe ratio (objetivo superior a 1,0), drawdown máximo (objetivo inferior al 20%) y número de trades (mínimo de 100 para significancia estadística). El win rate solo no tiene valor sin conocer la relación media ganancia/pérdida asociada.

El win rate sólo tiene sentido en relación con la tasa media de retorno por operación. Un win rate del 40% con relación 3:1 es más rentable que un win rate del 70% con relación 0,5:1. Prioriza el profit factor y el valor esperado en lugar del win rate aislado.

Verifica que el backtest incluya comisiones realistas, slippage estimado, ausencia de look-ahead bias y al menos 100 trades en el período analizado. Luego evalúa el profit factor y el drawdown máximo, y valida la estrategia en un período out-of-sample distinto del período de optimización.

Un Sharpe ratio superior a 1,0 se considera generalmente aceptable para una estrategia algorítmica según los estándares profesionales de gestión de portafolios. Por encima de 2,0 se considera excelente. Por debajo de 0,5, la estrategia asume demasiado riesgo para el rendimiento que genera.

El consenso en la comunidad cuantitativa es un mínimo de 100 trades para significancia estadística básica. Por debajo de ese umbral, los resultados pueden deberse al azar. Para alta confianza, apunta a 300 o más trades en el período de prueba.

Las señales de alerta incluyen: equity curve perfectamente suave sin caídas significativas, tests realizados sólo en períodos alcistas, parámetros muy específicos que sugieren curve-fitting y ausencia de validación out-of-sample. Si el rendimiento colapsa en datos nuevos, la estrategia tiene overfitting.

El Sharpe ratio mide el retorno en exceso dividido por la volatilidad total (ganancias y pérdidas). El Sortino ratio sólo penaliza la volatilidad negativa (las pérdidas). Para estrategias con picos de ganancias ocasionales significativos, el Sortino proporciona una imagen más favorable y representativa del riesgo real asumido.

Lecturas Recomendadas

Una curva bonita no basta.

Crea tu cuenta gratuita y haz el recorrido guiado: un backtest real de 10 años en 3 minutos, sin programar y sin tarjeta.

Crea tu cuenta en 30 segundos y ejecuta tu primer backtest. Sin tarjeta de crédito.