这里是《一分星愿》:只拆金融场景里的 AI 工作流——来源、实测、模板、风险边界。
上个月,我把一份 Agent 生成的板块简报递给做投研的朋友。他扫了 30 秒就退回来:"写得挺顺,但我没法用。"
退回的理由不是文笔,也不是结论对错。他说:"你这条判断,我复述不出来源。复查一遍的成本,比我自己写还高。"
《一分星愿》这个号只验证一件事:金融从业者能不能用上可复查的 AI 工作流。这篇就是本周的验证样本——输出看起来顺,不等于能进入投研流程。中间隔着的,是证据链。
被退回的研报,卡在哪一步
投研流程接收一份材料,默认要能回答四个问题:回答的是什么问题、关键事实从哪来、判断建立在什么假设上、人工该在哪抽查。
Agent 生成的内容,通常只在最后一环表现良好——分析写得头头是道。前面三环经常是空的:来源写着"据公开消息",假设压根没提,复核点为零。
于是每个接到产出的人,都要从头考古。这不是阅读问题,是审计问题。
GitHub 把"上线前"写成了流程
最近 GitHub Blog 连发几篇内容,说的其实是同一件事。
三篇合起来是一个判断:能被写下来、能被逐段检查的产出,才会被流程接收。工程圈的标准这么严,投研流程只会更严。
开源金融 Agent,正在把审计写进架构
再看开源这边。我最近扫 GitHub 上的金融 AI 项目,主趋势不是"谁更能生成",而是把数据源和复核机制写进架构。
公开层面能看到两个信号:ginlix-ai/LangAlpha 把自己定位成"Claude Code for Financial Market",1700+ star,今天仍在活跃更新;sandole/openbb-rag-financial-research-agent 则把检索范围明确锁在 SEC 文件、业绩电话会和研报上。
后者的思路值得注意:它先把"能引用什么"写死,再谈生成。当然,README 声称和实际效果是两回事,这类项目我只当趋势信号看,不当工具结论用。
学界方向类似:arXiv q-fin 里用 LLM 做投研的工作,这两年从"让模型直接预测"往"把研究流程拆成可复现步骤"转。这是我跟踪下来的观察,不指向某一篇具体论文。
我做的补字段实验:15 分钟,数出 3 个空格
我自己踩过这个坑。8 月行情助手实验期,它每天输出一份板块简报,我一直觉得"挺顺"。
复盘时做了个实验:拿其中一天的简报,手动按证据链字段回填。15 分钟填完,3 个空格——来源只写了"据公开消息",数据时点没标,复核点为零。
(建议截图位置:回填后的字段表,空格用红色标注)
那一刻我才明白朋友说的"没法用"。顺,是因为它替我省掉了那些不舒服的部分。
下一步我会把这张字段表做成 Prompt 前缀,让它在生成时就填满,而不是事后补。验证放在 9 月,做完写复盘,不提前下结论。
一张窄表,加七个问题
问题:这份材料回答什么问题
来源:每条关键事实的出处(链接或文件名)
假设:判断建立在哪几个假设上
时点:数据截止时间与版本
复核点:人工该重点抽查的 1-2 处
边界:它不能回答什么
拿到一份 Agent 产出,6 个字段能填齐,才往流程里递。完整版检查单(含每个字段的反例)已备好,后台回复「证据链」领取。
如果是在挑开源金融 AI 项目,换一张表。
数据源:接的什么数据,能否离线复现
回测复现:能否用同一份数据重跑
模拟/实盘隔离:下单路径是否默认隔离
日志:每步决策有没有留痕
权限:默认是不是最小化、只读
人工复核:关键动作有没有确认点
合规边界:README 对风险说不说真话
今天能试的一步
15 分钟,翻出你最近一份 Agent 生成的材料,按 6 个字段回填,数数空了几个。
空 0-1 个,可以继续用;空 3 个以上,先别递进流程。
你手上那份 Agent 产出,6 个字段能填齐几个?评论区说个数。
量化前沿 #金融Agent #AI投研 #证据链 #工作流
如果这篇文章帮你从信息流里筛掉一点噪音,欢迎继续关注《一分星愿》。下一次,我们继续用量化→算法工程师的视角,看一个值得试、也值得保持边界的信号。

研报速递
发表评论
发表评论: