博客

Agents 如何执行研究管线

2026年8月9日

English

《Alpha 的几何学》里我写过:一旦验证流程被冻结成纪律,AI agents 就可以通宵枚举候选、跑门控、写裁决、维护账本——「这值得单独写一篇」。在《一个人 + AI》里,我描述了让这句话成立的组织形态:先有纪律再自动化、三种不可转让的人类决策、产能与人头数解耦。

这篇补的是中间那一截。不是「我们用 AI 做研究」当口号,而是 agents 究竟如何执行一条研究管线——契约、走查、账本、fail-closed 路径,以及哪些位置上人仍然是唯一合法的执行者。

场景是 Dnalyaw:研究与执行共享同一条 pipeline 的垂直整合量化系统。原则可以推广到任何能被写清楚的研究过程。约束也真实:若某一步的正确性仍依赖执行者的意图才能判断,它就还没准备好交给 agent——它准备好的是被重新设计。

错误的心智模型

错误画面是这样的:研究员敲一句 prompt——「给我找一个新 alpha」——语言模型返回一个配方。那不是研究管线,那是聊天。

正确画面是这样的:一台预先注册好的机器接住一个候选假设,用冻结的阈值把它送过冻结的门,吐出结构化裁决,并把裁决追加进 append-only 账本。Agents 是这台机器的夜班操作员。他们不发明门,不讨价还价阈值,不在数字难看时「用判断力」圆过去。他们的工作是履行契约,不是赢一场辩论。

这和组织形态那篇里的检验是同一条,只是写成工程规则:这一步的正确性,能否在不询问执行者意图的情况下被验证? 能——agent 可以拥有这一步。不能——要么留给人,要么改到能为止。把仍含自由裁量的步骤交给 agent,并没有消灭裁量——它只是把裁量放大,并伪装成客观。

契约,不是感觉

一个 agent 可执行的研究步骤,是一份带四面接口的契约:

  1. 输入 — 允许读什么(时点数据、候选定义、开跑前已冻结的门控配置)。
  2. 工具 — 允许调用什么(研究副本上的查询、回测 runner、因子库、成本模型、组合历史)。权限最小:筛选 agent 没有实盘下单权。
  3. 输出 — 结构化产物:每道门 pass/fail、残差统计、所用成本假设、数据窗口哈希、一行给人读的摘要。自由散文是装饰;机器可读字段才是产品。
  4. 失败模式 — 超时、缺数、schema 漂移、非确定性、工具错误。每一种映射到编排器认识的终态:重试、记账后跳过、或叫醒人。在部分数据上默默成功,是禁止的。

四面缺一面,你就没有 agent 步骤,只有一个负载一高就会说谎的 demo。

编排在这里的重要性,就像厂房布局对流水线的重要性。我们的栈里,多步研究任务通过 Shannon 委派(以及 harness 那篇里写过的本地 runtime 模式):工具分发、预算、权限、可观察工作流。重点不是品牌名,而是 研究管线是一条带审计轨迹的 workflow,不是一次碰巧调了工具的长聊天。

一个候选,从头到尾

让一个候选走完全程。称它为 C——一个已被表达成代码与数据面的短周期残差特征,而不是一段故事。

Step 0 — 准入(Intake)。 Agent 把 C 物化成任务:版本化定义、所需数据面、以及本轮将使用的门控配置哈希。若配置哈希尚未冻结(仍是草稿),任务拒绝启动。没有「就这一次」的旁路。

Step 1 — 因子剥离。 工具拉取时点面板,剥离已知因子暴露,写出残差序列。输出:残差 IR / 显著性 / 暴露表。门控规则(冻结):残差必须越过预注册阈值。失败 → 账本 NO GO / factor-strip,停止。

Step 2 — 样本外。 评估窗口在看见 C 之前已注册。Agent 只跑这些窗口,不重挑更漂亮的切分。失败 → 账本 NO GO / oos,停止。

Step 3 — 净成本。 成本模型是回测到实盘落差那篇里写过的、由实盘成交校准的模型——不是拍脑袋的双边佣金幻想。扣费后死掉的残差是失败。失败 → 账本 NO GO / cost,停止。

Step 4 — 尾部相关。 对着现有组合最差的那些天测,而不是对着全样本的「看起来很分散」。失败 → 账本 NO GO / tail,停止。

Step 5 — 打包给人类准入。 只有四道门全过,C 才进入人类队列:一份短包(它是什么、残差证据、成本假设、尾部检验、与现有书的正交关系)加上完整产物链接。过工厂不等于准入。 准入回答的是统计回答不了的问题:它曾经成立的原因,明天是否仍成立——拥挤、数据源可持续性、与现有书的结构契合。

一个候选过夜——agents 跑线,人守最后一扇门准入配置哈希因子剥离只认残差样本外预注册净成本实盘校准尾部相关最差日人类准入决策NO GO → append-only 负知识账本已证伪方向不重挖,除非数据或角度变了agents 拥有 0–4 步 · 人拥有准入 · 实盘资金从不在这条路径上门控阈值在看见候选前冻结 · 部分数据是失败,不是软通过

大多数候选死在第 1 或第 2 步。这是健康。一个晚上产出零个人类数据包、三十条诚实的 NO GO,是成功的一夜。

账本是一等公民产物

工厂最值钱的产出常常不是信号,而是 失败了什么、为什么、在哪个配置哈希下、基于哪一版数据 的账本。

没有账本,过夜 agent 吞吐量是负债:你每周重挖同一条死路,烧掉算力,并慢慢相信「量大等于进步」。有了账本,拒绝开始复利。Agents 在烧完整轮门控之前会查:「这个家族是否已在等价假设下被证伪?」人类则把成簇的 NO GO 读成研究策略——哪块表面耗尽了、哪道门在做杀戮、特征菜单哪里太薄。

让账本成为真的几条操作规则:

  • Append-only。 不许把过去的 NO GO 改成软 maybe。更正是带原因码的新行,取代旧行。
  • 可按配置寻址。 没有门控配置与数据 vintage,裁决没有意义。可复现性是 join key,不是愿望。
  • 原因码,不是小说。 机器按码聚类;人只在异常需要叙事时展开散文。
  • 重挖策略。 重跑已证伪方向需要显式的新角度或新数据——不是新的 prompt 心情。

这是《Alpha 的几何学》里免疫系统那句话,写到 agent 能操作的粒度。

分工,写成路径

把组织形态里的决策映射回管线:

路径所有者为什么
从允许的表面枚举候选Agents高吞吐、可清单化
跑四道门 + 写结构化裁决Agents冻结后无自由裁量
维护账本 / 阻断重挖Agents + 确定性服务完整性是机械问题
日常研究运维(数据 QA、漂移旗标、任务健康)Agents异常才告警
准入实盘书前瞻理由、拥挤、信义义务契合
风险姿态 / 熔断参数效用函数,不是统计——见风控的两种语言
开新研究面或砍掉一条线反馈以月计,没有干净训练信号
下单或对实盘订单做风控绝不是研究 agent独立进程、绝对否决

既能「做研究」又能交易的 research agent 是范畴错误。哪怕工具面只是「好心」多开一点权限,也终将被用上。最小权限不是偏执,而是防止工厂变成影子执行路径。

Fail closed

Agent 管线会以无聊的方式失败;若 fail open,信任会先死:

缺数。 必需序列迟到或不完整时,门控不在子集上跑完并低声报 pass。它发出 blocked / data 并停止。残缺面板不是「大体还行」——它是另一个实验。

配置漂移。 运行中的门控哈希与冻结注册表不一致,则拒绝。会「更新阈值让筛选更干净」的 agent,是在以机器速度重新引入研究员偏差。

非确定性。 能钉住的 seed 与产物哈希就钉住,让重跑可比较。不能完全确定性时,记录方差带,把带外摆动当异常,不当作挑选好看 draw 的免费期权。

工具 / 预算耗尽。 Token、墙钟、查询成本的预算是硬停并写账本——不是默默截断候选集,让一夜看起来比实际更「严格」。

叫醒人的标准。 Agents 在基础设施失败、产物自相矛盾、或策略违规时升级。不为「我觉得这个残差有意思」升级。有意思不是终态。

这些规则和本站别处的生产级 agent 不变量是同一姿态——prompt cache 的字节稳定性mid-turn checkpointingflatten 校验。领域不同,姿势相同:显式状态打败希望。

人类的早晨长什么样

若夜里顺利,人不会重放工厂。他们打开一个短队列:

  • 四道门全过的包(常常是零到很少)。
  • 异常列表(数据阻断、预算杀死、哈希不匹配)。
  • 账本摘要(哪道门杀了多少、有无重挖企图)。

准入故意很慢。工厂的工作是让拒绝便宜且自动;人的工作是让接受稀有且昂贵。这种不对称才是产品。 反过来——接受便宜、拒绝昂贵——就是用更好的 GPU 复刻人头制基金的激励 bug。

这不是什么

不是自主科学。Agents 不发明特征本体、不定义因子库、不决定资本所有者的风险效用。

不是垂直整合的替代品。没有时点数据、没有实盘校准的成本、没有做尾部检验的组合历史、没有任何东西触达资金时独立的风控路径,工厂就是剧场——agents 会勤奋地以高吞吐吐出错误裁决。

不是宣称每一种量化过程都能 agent 化。高频微观结构直觉、关系驱动的 OTC、以及任何写不成显式规则的 edge,都在这个形态之外。和以前一样:写不下来的 edge,多半也不是能复利的 edge。

结语

行业会继续交付聊天窗口「做研究」的 demo。那种模式优化截图。研究管线优化的是 可重复的诚实:大多数候选死去,死亡被记录,幸存者仍面对一扇人的门,研究路径上没有任何东西能在不进入另一套带否决权的系统的情况下消耗实盘风险。

《Alpha 的几何学》说护城河是工厂。《一个人 + AI》说一旦纪律可执行,组织图就会塌缩。这篇是两句主张之间的接线图:agents 跑冻结的线;人守准入、姿态与方向;账本让拒绝复利。

配方会衰减。工厂会复利。Agents 只有在工厂在他们到来之前就已经是真的时,才帮得上忙。

本文是 Dnalyaw 量化系列的第六篇。前篇:一个人 + AIAlpha 的几何学风控的两种语言Dnalyaw:从零工程化一个 AI 量化交易系统回测到实盘的落差