从模型到实盘:StepOneAi 量化心得整理

量化交易最容易被误解的地方,是人们常把注意力放在模型、因子和收益曲线上,却低估了数据性质、成交假设、系统延迟、风险边界与团队协作的重要性。
2026 年 7 月,X 用户 @StepOneAi 连续发布了一组量化实战心得。内容从“复杂模型为什么容易过拟合”一路延伸到高频做市、策略衰减、研究能力、团队形成、回测撮合和延迟分布。本文不按推文顺序简单拼接,而是把这些观点重新组织为一套从研究假设走向实盘验证的方法框架。
说明:本文是对公开推文的主题化整理与分析,并非投资建议。推文中的收益、频率、生命周期和延迟数据来自作者经验描述,不能直接外推到其他团队、市场或交易所。
一、先理解金融数据,而不是先追求复杂模型

很多量化研究者会从技术工具出发:因子表现不够好,就继续增加特征、模型层数和搜索空间。XGBoost、LSTM、Transformer 都可能被搬进同一条研究流水线,直到回测曲线足够平滑。
问题在于,模型容量越大,并不意味着可交易信息越多。
金融数据通常同时具备两个不利性质:
- 信噪比低:绝大多数短期波动来自随机扰动和参与者博弈,真正稳定的 Alpha 很弱;
- 非平稳:宏观环境、市场参与者、交易规则和微观结构都在变化,历史规律可能随时失效。
高容量模型很容易记住历史样本中的偶然波动。在样本内,这会表现为更高的夏普和更低的回撤;进入样本外或真实市场后,模型却可能因为市场状态变化而迅速失效。
这并不意味着机器学习不能用于金融,而是意味着复杂度必须由样本规模、信号强度、验证方式和部署约束共同决定。对低信噪比任务,简单的线性模型、横截面排序、少量固定阈值甚至等权配置,往往更容易解释,也更能承受未知行情。
可以把研究目标从“把历史拟合得更好”改为三个问题:
- 这个信号为何可能存在?
- 它依赖哪些市场条件?
- 条件变化后,它会以什么方式失效?
二、高夏普不一定反常,先判断收益来自哪里
StepOneAi 用高频做市解释了一个常见认知差异:中低频方向策略如果出现异常高的回测夏普,通常需要重点排查过拟合、未来函数和成本遗漏;但高频做市可能呈现完全不同的收益分布。
原因不是某类模型更准确,而是两类策略赚取的收益不同:
- 方向策略依靠对未来价格变化的预测,需要承担持续的方向敞口;
- 做市策略通过双边报价提供流动性,主要争取买卖价差和可能存在的 maker rebate,同时承担库存风险与逆向选择。
高频做市把单次利润压得很薄,再通过大量交易样本分散随机波动。若每次交易具有稳定、微弱的正期望,频次增加可能使收益统计更平滑。但这不是无风险收益:一旦报价更新慢于市场、撤单未及时生效,或库存持续偏向单边,累积的价差收入可能被短时间亏损吞没。
因此,评价夏普时不能只看数字,还要追问:
- 收益来自方向预测、流动性补偿,还是隐藏的尾部风险?
- 交易频次是否足以支撑统计稳定性?
- 成本、滑点、库存敞口和极端行情是否完整计入?
- 真实成交机制是否被正确模拟?
三、策略是消耗品,真正的资产是研究流水线

一个策略开始衰减,未必代表最初的研究完全错误。金融市场是动态博弈系统,策略会受到至少两类变化影响。
1. 拥挤与竞争
当更多资金发现相似规律并开始交易,超额收益会被摊薄。频率越高、策略越依赖短暂的盘口特征,对手跟进和反向利用的速度通常越快。
2. 市场状态切换
策略可能只是适配某种波动率、流动性、资金偏好或监管环境。当这些条件改变,过去有效的关系就可能弱化甚至反转。
因此,成熟团队的壁垒通常不是某个长期保密的“神奇因子”,而是持续生产、验证和替换策略的能力:
flowchart LR
A[提出可解释假设] --> B[清洗原始数据]
B --> C[构造低自由度信号]
C --> D[保守回测与压力测试]
D --> E[小规模实盘验证]
E --> F[监控偏差与风险边界]
F --> G{信号仍有效吗}
G -->|是| H[逐步分配风险预算]
G -->|否| I[下线、归因与迭代]
I --> A
对个人开发者同样如此。与其把全部时间投入单个模型,不如建设可复用的数据清洗、特征生产、回测、部署和监控框架。当旧策略失效时,团队仍能快速验证新假设,并把失败原因沉淀为下一轮研究约束。
四、做策略需要的四种能力
在“做策略需要什么能力”一文中,StepOneAi 给出的答案并不是继续堆叠数学课程和编程语言。数学与编程是基础门槛,跨过门槛后,更稀缺的是以下能力。
1. 市场微观结构的直觉
研究者需要理解订单进入盘口后发生了什么:前方排队量有多少、订单何时获得成交、撤单与成交如何竞争、盘口为何突然变薄。GLFT、Avellaneda–Stoikov 等模型提供了框架,但框架不能替代对逐笔数据的长期观察。
2. 对回测保持怀疑
看到漂亮曲线时,第一反应不应只是庆祝,而应检查哪里可能算错:成交条件是否宽松、队列是否被忽略、延迟是否写死、费用是否取了理想档位。回测首先是暴露问题的工具,其次才是估计收益的工具。
3. 风控先于收益
策略设计应先回答“什么情况下会出问题”,再回答“正常情况下能赚多少”。停止条件、库存上限、最大可接受回撤和异常延迟下的保护动作,通常比进一步优化少量收益更重要。
4. 足够可靠的工程能力
研究者不一定要成为顶尖系统工程师,但必须能够:
- 处理原始逐笔数据;
- 尽量让回测和实盘复用同一套核心逻辑;
- 区分策略失效、数据错误与基础设施故障;
- 定位精度、溢出、类型转换和状态同步问题。
更有效的学习闭环是:提出假设,用苛刻口径回测,以极小风险进入实盘,解释回测与实盘的差异,然后继续迭代。失败本身不是研究成果;把失败原因解释清楚,才是可复用的经验。
五、团队不是角色列表,而是共同处理过故障的人
另一篇长文讲的是团队形成。StepOneAi 回忆,他们在 NTU 学习期间便开始共同搭系统、写策略和跑回测。早期缺少资金、经验和成熟框架,很多假设会被推翻,回测结果也经常无法在实盘中复现。
团队价值并不只是把工作拆成“策略、基建、风控”几个岗位,而是让每一块都有可以信任的负责人。当出现回撤或系统故障时,有人检查策略假设,有人核对数据与延迟,有人控制整体风险。长期共同排查问题所形成的协作方式,很难通过临时招募直接复制。
对量化团队而言,这也说明技术栈之外还有一项重要资产:一套在压力下仍能完成归因、决策和止损的协作机制。
六、回测最容易在哪些地方欺骗研究者

StepOneAi 的“回测一、二”给出了六个具体检查项。这部分是整个系列中最适合直接转化为工程清单的内容。
1. 不要把触价直接记为成交
如果市场价格刚好碰到挂单价,回测便认为订单成交,就相当于默认订单始终排在队首。实际做市订单通常需要排队,是否成交取决于前方队列量与后续成交量。
更严重的是,这种宽松规则可能产生方向性偏差:价格触及后反转的订单往往更有利,却最容易被虚假计入;价格穿透挂单价的订单通常更不利,但几乎一定会成交。结果就是有利样本被高估,不利样本仍被保留。
在缺少精确队列模型时,可以采用更保守的“穿价成交”口径。它会漏掉部分真实成交,但通常比系统性高估收益更安全。
2. 队列模型必须与延迟模型联动
延迟不仅改变成交时的市场价格,还决定订单何时进入订单簿,以及进入后排在什么位置。一个固定的 5ms 常数无法表示真实网络、网关与撮合引擎的波动。
3. 回测与实盘要检查变量类型
两套系统即使逻辑描述一致,也可能因为数值精度、整数溢出或隐式类型转换产生差异。这类错误难以察觉,因为两边都能正常运行,只是结果始终无法严格对齐。
4. 做市研究需要足够精细的原始数据
通用研究可以使用快照或聚合数据,但对订单簿精度敏感的策略,应尽量使用交易所原始增量数据逐条回放。快照重建和降采样会破坏队列信息,使精细的撮合模型失去依据。
5. 冲击成本和费率采用保守假设
历史市场不会因回测中的虚拟订单改变行为,因而天然忽略了策略规模增大后的市场冲击。maker 费率、返佣档位与资金费在边际利润很薄时也可能决定策略最终是正收益还是负收益。无法准确估计时,应优先使用更差而不是更理想的参数。
6. 回测的核心输出是系统底线
比收益曲线更重要的问题包括:
- 策略在哪类行情下亏损?
- 最大回撤和恢复时间是多少?
- 行情延迟增加后,系统只是少赚,还是会产生反向持仓?
- 单边行情中库存会累积到什么程度?
- 哪个阈值必须触发降仓、熔断或停机?
只有这些边界被测试清楚,团队才能决定策略是否上线,以及分配多少风险预算。
七、延迟不能是常数,要把长尾风险放进回测

延迟分布是系列后半段最重要的工程观点。真实市场不存在始终固定的响应时间。网络抖动、交易所负载和网关排队都会使延迟形成分布,并可能带有明显长尾。
假设观测到的延迟样本大致分为三段:多数请求在低延迟区域完成,一部分在拥堵时明显变慢,少量极端请求出现几十毫秒的卡顿。回测不应为每次事件赋相同延迟,而应从实测分布中抽样,并在压力测试中增加极端情形。
长尾尤其重要,因为大额亏损往往集中在市场剧烈波动和系统拥堵同时发生的时刻。固定延迟模型可能判断撤单已经生效,真实系统却仍在排队,最终使旧报价暴露给具有信息优势的订单流。
同时,至少应区分三条链路:
flowchart TD
M[市场事件] --> A[行情链路延迟]
A --> S[策略看到新状态并计算报价]
S --> O[下单链路延迟]
O --> B[订单进入交易所队列]
M --> R[风险条件触发撤单]
R --> C[撤单链路延迟]
C --> X{撤单先于成交生效吗}
B --> X
X -->|是| Y[风险敞口解除]
X -->|否| Z[发生成交并承担库存或逆向选择]
行情推送、新单和撤单可能经过不同网关与排队机制。把三者混在一个总延迟池中,会使队列位置、成交概率和风险暴露与实盘不符。
八、盈亏同源:收益曲线为何不能替代风险解释
StepOneAi 在番外中解释了不公开实盘曲线的理由。公开截图很难证明完整业绩:它可能只展示对冲组合的一条腿,也可能来自多个账户或多个信号中的幸存样本。真正具有验证效力的材料通常需要托管记录、审计报告和逐笔对账,并在正式尽调中检查。
更重要的是,收益曲线只展示已经兑现的结果,不会完整呈现策略承担的敞口。做市利润来自承担库存风险和逆向选择,并换取价差与返佣;同一项风险在正常市场中贡献收益,在极端市场中也会制造亏损。
因此,一条过度平滑的曲线不应首先引发羡慕,而应引发调查:
- 尾部亏损是否尚未发生?
- 杠杆和未实现风险是否被隐藏?
- 是否存在账户或时间区间筛选?
- 策略承担的真实敞口是什么?
对策略的信心,不应只来自“过去赚过钱”,而应来自对亏损条件、深度、持续时间和停止边界的理解。
九、把整组心得压缩成一套实盘研究准则
综合这些推文,可以提炼出以下准则:
- 从市场机制出发,而不是从模型名称出发。
- 优先控制自由度,再追求样本内表现。
- 根据收益来源解释夏普,不脱离交易机制看指标。
- 默认策略会衰减,把研究流水线视为长期资产。
- 用原始数据、保守成交和真实成本约束回测。
- 分别建模行情、下单和撤单延迟,并关注长尾。
- 让回测回答亏损边界,而不只是预估收益。
- 通过小规模实盘解释偏差,不直接从回测跳到放大资金。
- 建立跨策略、基建和风控的故障归因机制。
- 不把收益截图当证据,把可检验的方法放在展示之前。
这套方法的共同点,是主动降低自我欺骗的空间。复杂模型、漂亮曲线和高收益指标都可以成为研究线索,但只有在成交、成本、延迟、风险与实盘偏差经得起检查时,它们才可能转化为可部署的策略。
参考来源
本文主要整理自 @StepOneAi 在 2026 年 7 月发布的公开内容:
- 量化心得二:复杂模型与过拟合
- 量化心得三:高频做市在赚什么钱
- 量化心得四:策略往往是消耗品
- 量化系列:做策略需要什么能力
- 量化系列:关于团队
- 番外:盈亏同源,为什么不发实盘
- 量化心得九:回测(一)
- 量化心得九:回测(二)
- 量化心得十:回测中延迟分布采样
整理范围截至 2026 年 7 月 29 日。本次共核实 9 条量化主题长文;公开检索中未找到“量化心得一”及编号五至八的可验证原文,部分标题编号也存在重复或不连续,因此本文仅整理能够核验的内容,未补写缺失篇目。
克制:AI时代最稀缺的工程能力
OKX 注册忘记填邀请码怎么办?补绑、换绑与返佣完整指南