回测的盲区:为什么公布的胜率几乎无法在实盘中存活

每周,在Telegram、YouTube或信号供应商的页面上,都会出现一张图表:一条平滑向上的权益曲线,胜率超过80%,标题写着"经过5年回测"。零售交易者已学会对营销语气保持怀疑,但很少有人质疑数字背后的方法论。这才是真正的盲点——并非供应商虚报胜率,而是胜率的计算方式从一开始就无法在产生它的电子表格之外成立。
这不是一个狭隘的技术争论。它是零售策略在纸面上统计表现良好却在实盘账户中失败的最主要原因。以下按通常造成最大损害的顺序,列出五个关键漏洞。
1. 隐藏在指标内部而非策略中的前视偏差
大多数交易者会检查入场/出场逻辑是否存在前视偏差——"我是否用明天的收盘价来决定今天的交易?"——但很少有人检查输入该逻辑的指标。两个常见漏洞:
- 重绘指标。许多流行的自定义指标(某些ZigZag变体、"聪明钱概念"订单块工具、自适应移动平均线)会在新K线收盘时重新计算历史值。今天运行的回测看到的是每个历史K线的最终重绘版本——一个在实时交易中从未存在过的版本。策略看起来完美捕捉了每个波段高低点,因为事后看来确实如此。
- 同K线执行。回测在信号条件满足的当前未收盘K线上立即触发入场——而非等待该K线收盘并在下一根执行——这相当于用尚未实际可用的信息进行交易。在1小时图表上,这可能会显著夸大策略的表观优势,因为回测被悄悄允许在决定是否入场前"看到"K线的收盘位置。
这两种情况都无法通过肉眼观察权益曲线发现。你需要检查指标的历史值在多次运行中是否静态不变,以及回测引擎是在K线收盘还是开盘时执行。

2. 仅发布幸存策略的幸存者偏差
如果供应商对同一基础策略运行40种参数变体,发布表现最好的2种,并悄悄淘汰其余38种,那么营销材料中的每个数字都是真实的,但每个数字都毫无意义。这是应用于策略选择而非资产选择的幸存者偏差,在信号销售和EA销售领域普遍存在,因为没有类似基金经审计业绩记录的对等物——没有任何东西能阻止供应商只展示幸存者。
问题不在回测本身,而在于缺失的信息。一条完美的权益曲线,若未提及产生它的参数搜索过程、无样本外测试期、也未讨论被丢弃的变体,应被解读为"这是未知次数尝试中的最佳结果",而非"这就是策略的实际表现"。
3. 将点差和滑点建模为静态最佳情况
这是与工具和计算器受众最直接相关的一点,因为它是一个建模错误而非判断错误——意味着只要知道如何检查,就可以修复。
大量零售回测平台允许策略在固定点差(例如EURUSD 1.2点)下运行,并统一应用于整个测试期。实际点差并非固定。它们在伦敦/纽约重叠时段扩大,在NFP和CPI发布时急剧扩大,在XAUUSD等金属上,意外数据公布后的几秒内可能从个位数飙升至40+点。一个依赖新闻事件波动性来获取优势的策略——这描述了大部分零售突破系统——其回测胜率假设始终能在平静的平均点差下成交。而在实盘交易中,它恰恰在试图交易时遭遇最差点差。
同样的情况也适用于快速市场中断损和止盈订单的滑点,以及持仓过夜的隔夜利息/展期成本——这些在默认回测设置中经常被设为零且从未重新启用。

4. 伪装成"优化"的曲线拟合
存在一种有意义且诚实的参数优化版本,以及一种不诚实的版本,而从外部看,它们会产生外观相同的图表。
诚实的版本:在一段历史数据(样本内)上优化参数,然后在优化器从未见过的后续数据段(样本外)上测试未更改的参数,理想情况下在多个滚动窗口上重复(向前分析)。如果样本外表现保持稳定,则优势更可能是真实的。
不诚实的版本——通常并非恶意,只是方法论上的粗心——是直接针对整个历史数据集进行优化,直到权益曲线看起来良好,而不保留任何数据用于验证。这总会产生看起来极佳的回测,因为只要有足够的自由参数(移动平均线长度、RSI阈值、ATR乘数、时段过滤器),任何足够灵活的策略都可以被调整以拟合固定数据集中的噪声。这里有一个有用的经验法则:参数数量相对于样本中独立交易数量的比例——一个具有8个可调输入、基于60笔交易验证的策略几乎肯定过拟合,无论曲线看起来多么干净。

5. 胜率报告未考虑路径依赖或相关性
一个策略可能拥有真实且可复现的70%胜率,但仍比一个40%胜率但风险回报比健康的策略更可能爆仓,因为胜率本身无法说明结果的序列或亏损的聚集方式。
供应商公布的统计数据中几乎普遍忽略了两点:
- 现实亏损序列下的破产风险。70%胜率的策略在足够大的样本中仍会产生5、7、甚至10+笔交易的连续亏损——这是基本的二项式方差,而非运气不佳。如果仓位规模假设亏损均匀分布,那么统计上并不罕见的连续亏损仍可能造成财务上的致命打击。
- "分散化"信号之间的相关性。运行五个各自具有独立验证优势的信号源,如果它们都是做多美元的偏向性交易,且在同一宏观意外事件中全部亏损,那么你并没有获得五个独立赌注。相关头寸的总体回撤会以单个信号回测(孤立评估时)从未揭示的方式叠加。
这两点都需要对交易序列进行蒙特卡洛风格的重采样,而不仅仅是单次历史运行——几乎没有任何面向零售的回测报告包含这一点。
信任任何已发布胜率前的五点检查清单

- 报告是否指定了K线收盘执行?指标的历史输出在多次重新运行时是否稳定(无重绘)?
- 是否有样本外或向前分析段,还是整个数据集是一个连续的优化窗口?
- 点差是否建模为可变(新闻窗口期间点差更宽)?是否包含滑点和隔夜利息?
- 策略的可调参数数量相对于回测中的交易笔数是多少?
- 破产风险是否基于实际交易序列(或其蒙特卡洛重采样)报告,而不仅仅是胜率和平均盈亏?
这些都不需要信任供应商的诚实——它们是任何人都可以要求的方法论检查。一个无法回答这些问题的策略或信号供应商不一定在撒谎,但他们尚未完成必要的工作来确认自己的数字是否真实。
交易涉及重大风险。历史或回测表现,无论以何种方式计算,均不保证未来结果。
常见问题 — 回测与策略评估
外汇和黄金交易中的回测是什么?
回测是将交易策略应用于历史市场数据,以观察其表现的过程。它回答的问题是:"如果我在过去X年严格按照这套规则交易,我的equity curve、win rate和drawdown会是什么样?" 一个正确的回测应使用out-of-sample数据(策略未经过优化的时间段)、可变spread模型以及bar-close执行方式,以避免look-ahead bias。没有这些保障,回测结果在统计上毫无意义。
为什么大多数回测表现良好的交易策略在实盘中会失败?
五个方法论缺陷导致了绝大多数实盘交易的失败:(1) repainting指标会显示历史修正值而非实时信号;(2) survivorship bias导致只有表现最好的参数变体被公布;(3) 静态spread和slippage假设忽略了新闻事件期间的真实市场状况;(4) curve-fitting使参数针对噪声而非真实优势进行优化;(5) 缺少路径依赖性分析,忽略了亏损序列如何放大风险。每个缺陷都能让一个毫无价值的策略在纸面上看起来统计可靠。
交易策略回测中的look-ahead bias是什么?
Look-ahead bias发生在回测意外使用了每次模拟交易时尚未获得的信息。最常见的形式是same-candle执行——在当前未收盘的K线上触发入场,而非等待其收盘。这让回测在决定是否入场前"看到"了K线的最终形态。另一种形式是使用repainting指标,其历史值会随着新K线形成而变化。两者都会夸大表面优势,产生在实时交易中无法复现的win rate。
交易指标中的repainting是什么?为什么它对回测很重要?
Repainting是指指标在新价格K线收盘时重新计算并改变其历史值。常见例子是ZigZag指标重绘过去的摆动点,或自适应移动平均线改变其历史曲线。当你今天运行回测时,看到的是每个历史K线的最终重绘版本——一个在实时中从未存在过的版本。策略看起来完美捕捉了每个波动,因为事后看来确实如此。这是零售交易工具中回测表现被夸大的最常见原因。
交易策略选择中的survivorship bias是什么?
策略选择中的survivorship bias意味着供应商测试了同一基本思路的40个参数变体,只公布表现最好的2-3个,而从不提及其他37个失败的变体。公布报告中的每个数字在技术上都是真实的,但选择过程使它们毫无意义,因为你只看到了未公开优化竞赛中的幸存者。缺少out-of-sample测试期、walk-forward验证或任何关于被舍弃变体的讨论,就是明显的警示信号。
spread和slippage如何影响外汇和黄金回测的准确性?
大多数零售回测平台默认使用固定spread(例如EURUSD的1.2点),在整个测试期间统一应用。在实盘交易中,spread是可变的——在伦敦/纽约重叠时段扩大,在NFP和CPI发布时急剧飙升,XAUUSD的spread可能在几秒内从个位数扩大到40点以上。快速市场中的止损和止盈订单的slippage,加上隔夜swap成本,进一步加剧了差异。使用静态spread假设测试的策略在纸面上总是比实盘表现更好,尤其是当它在新闻事件附近交易时。
交易策略优化中的curve-fitting是什么?
Curve-fitting,也称为过度优化,是将策略参数调整到适应固定历史数据集的特定噪声模式,而非捕捉真实、可重复的市场优势。只要有足够的自由参数——移动平均线长度、RSI阈值、ATR乘数、时段过滤器——任何策略都能在历史数据上看起来盈利。诚实的替代方案是walk-forward分析:在一个时期(in-sample)优化,在后续未见过的时期(out-of-sample)测试,并在多个滚动窗口上重复。经验法则:一个有8个可调输入、仅用60笔交易验证的策略几乎肯定过度拟合,无论equity curve看起来多么平滑。
零售交易者如何评估已发布交易策略的回测质量?
五个问题可以穿透营销迷雾:(1) 回测是否使用bar-close执行和非repainting指标?(2) 是否有真正的out-of-sample时期,而非连续的优化窗口?(3) spread是否建模为可变,并在新闻事件附近设置更宽水平,是否包含slippage和swap成本?(4) 策略的可调参数数量相对于其独立交易数量是多少?(5) risk of ruin是否根据实际交易序列,使用Monte Carlo重采样计算,而非仅基于win rate和平均盈亏?无法回答全部五个问题的供应商,尚未完成验证自身数字真实性的必要工作。


Leave a Comment