Flow brief 2026-09-12 · 例子是编的 · 不是荐股

金融 AI 的第一能力不是预测,是过滤

公开信息不缺。缺的是判断:这条跟今天的决策有没有关系,噪音有多大,值不值得看。 这种判断很难说清,但能拆成几道具体的题,反复考。

说「第一」不是说预测不重要。预测要先有输入;输入没筛过,模型预测得再准,也是在错的材料上准。过滤是模型最先要过的那一关,排在预测前面,不是压在它上面。

01

一个会错的判断

按题材分,下面每一对都会被标成「相关」。当班的人当时只会留其中一条。

先看两条都「像金融」的新闻。一条是地缘政治:某位政治人物坚持要拿下一块地方,标题里有国家、有冲突、有权力,没有时间表,没有可执行的动作。另一条也是地缘政治:同一个人威胁对主要贸易对手加税,说了税率,说了哪天生效。只按题材分,两条都会被标成相关。做过美股宏观的人当班时会把第一条放一边,把第二条留下——不是因为知道后来市场怎么走,是因为第二条当时就有对象、有数字、有日期。本文说的「相关」,全都按这个标准:当班的人当时会不会留。后来有没有改价格,是另一件事,不能拿来当答案。

再看更日常的对照。下面的账号按「该怎么读」起的假名,公司名是真的,帖文和数字是编的,只用来对照。

两边都像金融 NVIDIA · GOOGLE · OPENAI · 编的例子

同一个账号,同一小时

@大V老板亿级粉丝 · 议题能左右市场

这场选举就是个马戏团。不过我们的模型更好笑。

丢掉 · 政治 / 玩笑
@大V老板同一账号

自家集群这季利用率九成以上,排队的训练任务比上季多了三成(数字是编的)。HBM 仍比晶圆更紧。

留下 · 报了自家的数

同一家公司,两种来源

@搜索巨头官方号传播极高

今天的涂鸦庆祝搜索 28 周年。感谢你一直在输入。

丢掉 · 沾到 Google,没有新东西
@快讯10-Q 日

Google 这季资本开支高于街上预期,多出来的钱主要在芯片和机房,不在搜索广告。(数字是编的)

留下 · 改了开支节奏

同一家公司,官方号 vs 负责人

@模型实验室官方号官方预告

下周有大事。敬请期待。

丢掉 · 标题党,没说出一件事
@模型实验室CEO产品定价

推理接口本周降价(幅度是编的)。我们有产能,要的是用量。

留下 · 价格和产能
左边三条,只按「AI、大公司、粉丝多」分,会被留下。右边三条,当班的人当时会留:每条都说出了一件具体的事,NVIDIA 需求、Google 开支、OpenAI 定价。分类看题材,人看的是:对谁的决策有用,这个号此刻该怎么读。

今天的大模型像一个不知疲倦、什么都读过、但没亏过钱的研究员。写代码、翻译、做摘要,它都能先交一版。于是真正难的变成两头:问什么问题,以及结果信不信。过滤是最先碰到、也最容易做假的那一层。这一关过不了,后面写得越顺,噪音加得越快。

02

其实只看两件事

别让模型打一个笼统的「好不好」。看人平时到底在做什么决定。

一条材料进不进今天必看,其实只问两件事。跟谁的决策有关:不是像不像金融,而是对此时此地做 AI、半导体的人,它是相关而且值得看、相关但无聊,还是根本无关。噪音怎么折:同一个号,有的帖是一手,有的是水文;有的号已经替你筛过,有的号默认只能当传闻。信噪比不是把账号分成三六九等,是这个号该怎么读。

相关:不是题材,是决策

通用模型擅长按题材归堆:标题里有关税、芯片、AI、央行,就往「金融相关」靠。人的判断更窄。对做宏观的人有用,和对看半导体的人有用,不是一回事。一家小公司上市,财务上当然相关,宏观的人可能完全不想看。提示词写成「这是不是财经新闻」,模型按定义就该留下它;改成「相关而且值得看 / 相关但无聊 / 无关」,至少题问对了。分数会不会因此上去、上去多少,要像第七节那样分开跑才知道,这里先不下结论。

先说清楚我们看什么 只看 AI、半导体、算力

真该看进必看

  • @半导体CEO:下半年卡在存储,不在晶圆供给紧在哪
  • @快讯:Google 开支超预期,多出来的在芯片钱往哪花
  • @模型实验室CEO:推理接口降价价格和产能

看着相关最骗人

  • @产业搬运:听说下一代模型再延六周像事实,先当传闻
  • @并购快讯:AI 食堂创业公司要上市财务上相关,我们不看
  • @模型实验室官方号:「下周有大事」没说出一件具体的事

无关直接出局

  • @搜索巨头官方号:涂鸦周年
  • @大V老板:选举玩笑
必看只在第一档。第二档最危险:题材像 AI、像金融,通用模型会留下。相关必须先说清楚我们看什么,范围一变,标准就变。不说清楚看什么,所谓相关只是在做题材分类。

光改提示词还不够。能写进提示词的,只是人说得出口的那部分。真正决定「今天这条留不留」的,往往是亏过钱才有的感觉:这类标题以前怎么被定价,这个人什么时候在报信,什么时候在表演。

信噪比:不是名气,是读法

我们给真实账号写过一批很短的备注。不像论文,更像值班时跟同事说的那句话。四种最常用的读法:

信噪比是读法,不是粉丝数

粉丝多,噪音也多

@大V老板

他谈 AI、算力、NVIDIA,市场会动。但他也灌水、骂政治、开玩笑。

怎么读:水、政治、玩笑一律挡掉;先看内容,再谈有没有新东西。

别人筛过一轮

@卖方TMT

已经替你挑过的卖方观点,个人色彩轻。

怎么读:看他说了什么新数字、新阶段,别看包装。其实挺干净。

先当传闻

@产业搬运

消息不少,真假难辨。

怎么读:最多当传闻,必须标清楚;没第二个人确认,不能当事实进必看。

只看标题

@快讯

财报和新闻发得很快,像接线员喊单。

怎么读:标题里的事实有用,后面的分析多半没增量;没确认别抬到最高档。

这些话单独看不像标签,但已经能执行。账号档次可以留,但只能当很弱的参考:看的领域对不上就当零,最多帮一点排序。真正管用的是规矩:没确认的传闻不能当事实,快讯不能无凭据抬到顶,纯转发不算又来了一个人,同一件事说两遍要并掉。规矩的意思不是「模型应该听话」,是它想绕也绕不过去。

按热度排的现成做法,会把粉丝多、传得广、写得像研报的东西抬上去。我们的顺序反过来:先问这个号会不会浪费你的时间,再问他这次有没有新东西。

03

同一批帖,两种看法

我们只看 AI、半导体、算力。时间截到 2026 年 9 月 11 日下午 4 点(纽约)。下面 14 条是编的,用来对照。

按「权威、题材、传得广」来排,会留下名人玩笑、没确认的传闻、同一条卖方笔记的转发,同时把粉丝少、但说了具体事的帖直接压掉。按我们的规矩:留下当时就会留的具体事实,传闻先看着,重复的并掉,水文丢掉;粉丝少不是丢掉的理由——能对公开材料核对的进必看,单源自述的先看着。

点一下,换一种看法 按热度来

  • 错1玩笑、灌水进了必看
  • 错2没确认的传闻当成事实
  • 错3转发当成又来了一个人
  • 错4广告、空预告进了必看
  • 错5相关但无聊的进了必看
  • 漏1粉丝少、但说了具体事的帖被直接压掉(该留或该先看着,却丢了)
两列都是人先写好的答案,不是模型自己打的分。错法和漏法也是在看任何模型输出之前定的。这张图是在出题,不是在证明谁赢。漏掉该看的,比多留几条水文更贵:多留的水文看一眼就能丢,漏掉的那条你根本不知道它存在过。一个总分会把这件事抹平。把噪音压下去,不是少显示一点,是同一批材料里必看更薄,两类错都变少,留下的每条都能点回原文。
04

为什么这件事正在变难

不是模型更笨,是两个老过滤器坏了:「讲不出道理」,和「不知道后来发生了什么」。

大模型带来两层麻烦。一层是它极会事后编故事:你丢给它任何一条热点,它都能很快讲出一套听起来有道理的金融解释。过去「讲不出道理」还能当过滤器,现在这个过滤器坏了。有信息量的不是解释本身,是它写在看见结果之前还是之后。另一层是它记得太多历史。它「知道」某些年份后来发生了什么。只要让它参与「这条重不重要」,它给你的可能不是判断,是记忆。演示里不会报错,真用的时候才会收费。

这两层各对应一条考法。对「会编故事」:分数只看四道题答对没有,跟解释写得多顺无关。对「记得历史」:卷子截到某一天,题面和模型都看不见之后的事。第六节会说到,光挡住模型还不够,写答案的人也在 2026 年。

后面还有提问、核对、把流程跑起来这些本事,当然重要。实现变便宜之后,会问好问题的人和会把关的人会更值钱。但那是后半场。要说清一点:「我们看什么」这个范围是人先定的,不是模型定的;这里说过滤是第一关,是指范围定了之后,模型最先要过的那一关。相关和噪音这两关不过,提问是在更大的垃圾堆里提问,核对是在给噪音盖章。

05

现成尺子为什么不够

缺的不是「会不会读财报」,是「会不会决定今天看什么」。

现成尺子看不见的错最贵:把当时就该先看着的传闻直接丢掉;把旧闻当新;把转发当成又来了一个人,系统以为「很多人都在说」,其实是同一个人被复制了多次;把水文送进必看。这不是总分多一个点少一个点,是看盘的人还会不会信你。

06

怎么把说不清的判断做成能考的题

别考「好不好」三个字。考人平时真会做的那几下。

先定输入长什么样。不是一段洗干净的正文,是一条完整的材料:原文、谁发的、什么时候、是原发还是回复、引用、转发,外加一句人写的读法。没有作者、没有时间、没有引用关系,模型只是在做阅读理解,不是在帮你决定今天看什么。

先冻住这四道题 少、稳定、能对答案

01

跟我们看的东西有关吗

必须先说清楚我们看什么。搜索涂鸦周年在这里无关;Google 开支超预期,相关而且值得看。

02

这条是什么

事实、传闻、观点、玩笑。四选一不算漂亮,但够用。模型最容易把传闻写成事实,把玩笑写成观点。

03

说到谁了

公司、主题、事件。绑错和没绑都是错;没有对象却被写成大事,多半是被文笔带着跑。

04

该不该进今天必看

这才是真正的产品题,前面三道都为它服务。相关但无聊、有关但是复读、有关但是没确认,都可以相关,却不该进必看。

账号备注是第零层,不是第五个分数。它不直接打分,它改读法。人亲手写过、而且不是套话的那句,才能变成规矩;「偶尔有一两条可以参考」这种模板,只能当软参考,否则全库都会长出假纪律。

冻住什么,比换哪个模型重要。一套能反复考的卷子,至少要冻住:哪些账号、每个账号那句人写的备注、截到哪一天、标准答案、以及上一节那张错误表。备注跟着账号一起冻,因为它是题面的一部分,不是可换的配件。截到哪一天,是为了不让模型看见后来发生了什么。

但冻日期只挡住了模型,没挡住写答案的人。标答是 2026 年的人写的,他知道后来怎么样了。这是真实的泄漏,不是理论上的。补法只有两种:截止日在过去的题,标答用当时留下的值班记录、当时的笔记,不用今天的回忆;没有当时记录的,两个人互不见面、只拿截止日之前的材料各标一遍,对不上的题不进卷子。

标准答案怎么定,要分两份材料说。调参那份可以留争议通道:外包标的看起来整齐,常常是错的;模型和现有标签对不上的,送到人重标——对不上,要么真难,要么原来就标错了。考卷那份不走这条路:两个人独立标,报一致率;两人对不上的,删掉或者单列成争议题另算;模型的输出永远不能触发考卷重标,否则就是按模型的答案改答案。

做到这一步,「我觉得这个号很吵」就变成能对的题:在冻住的账号和日期上,模型会不会做对那四道题;把账号规矩关掉之后,不该留的和该留却丢的会不会明显变多。后一个对比,才是降噪有没有用。

为什么要自己出卷,不要刷公开榜

有一组公开数字可以借来参照,先说清它的边界。2026 年,Bridgewater 和一家模型实验室公开过一次实验,任务和本文不一样:这篇文章值不值得读、这份央行文件有没有方向、这封邮件从哪开始是套话。他们报的数字:最强的通用模型随便问一句,差不多是掷硬币;加上专家写的提示词,到七十多分,没过八十;用他们自己的人标过的数据微调一个开源模型,准确率 84.7%,用起来便宜了一个数量级。

~50%最强通用模型,随便问一句
70 多加上专家提示词,仍不到 80%
84.7%用自己人标的数据微调
~13.8×更便宜

这组数字能说明的只有一件事:在那几个任务上,提示词停下来之后,自己人标的数据还能把分推上去。它证明的是模型学到了他们标注者的判断,不是学到了市场;84.7% 是和他们自己标注者的一致率。它没证明这种能力别人抄不走——任何人拿同样任务、同样质量的标签去微调,未必到不了。它也没证明我们的任务会有同样的曲线,因为任务不同。

所以自己出卷的理由,不是「能长出抄不走的能力」,而是第五节那条:公开榜考的不是我们要的那道题。我们要做的是一套自己的过滤考题:在我们看的范围内,用我们的读法,决定一条材料该不该占用注意力。相关和噪音是前两道。提问和核对,是下一场考试。

07

这些是模型能力吗?题具体怎么出

先分清三层,再出题。混在一起,分数会骗人。

不全是模型能力。上面说的事,其实叠了三层。混着考,你会分不清:到底是模型变聪明了,还是提示词写得好,还是规矩把错路堵死了。

1. 流程必须卡住的

考卷模型够不着、没确认的传闻不能当事实、转发不算又来一个人、同一件事并成一条。这些不该交给模型自觉。考它们,考的是系统,不是智力。

2. 提示词能抬一截的

把「我们看什么」写进提示词,把标签从「是不是财经」改成「相关而且值得看 / 相关但无聊 / 无关」,把账号备注放进题面。这一层装的是人说得出口的部分。按本文的读法,Bridgewater 那组从五十到七十多,主要是这一层在动——这是我们对别人数字的归类,他们没这么分。他们的专家提示词停在七十多,只说明那次到了那儿,不说明提示词一定到顶;例子也能塞进提示词,所以第二层和第三层的边界,要靠下面的考法划,不靠感觉。

3. 剩下才是模型能力

同一个人,哪条是报数、哪条是灌水;粉丝很少但说了具体事的单源,该不该排在名人玩笑前面;一句「听说」到底有多硬。这些说不出口,提示词装不下。他们用自己人标的数据微调到 84.7%,多出来的那一截,我们记在这一层:规矩和提示词没变,变的是模型。同样,这是本文的归法,不是他们的结论。

所以这套卷子要拆开打分。系统规矩单独考:关掉规矩,错会不会爆。提示词单独考:同一模型,有没有「我们看什么」、有没有账号备注。模型能力只看第三层:规矩和提示词都冻住,换模型、换训练,分数还会不会动。

你们给账号写的那句备注,两边都沾。写成系统规矩的部分(没确认当传闻、名人玩笑挡掉)不是模型能力;模型要不要读这句备注才能做对「同一人两条留哪条」,才是能力。降噪效果也要拆:规矩开和关比一次,提示词有和无比一次,不同模型再比一次。只报一个总分,分不清药在哪一端。

一张考题长什么样

每道题必须带齐这些,缺一样就不算过滤题,只是阅读理解:

我们看什么(例如只看 AI、半导体、算力);截到哪一天哪一小时,题面和模型都看不见这之后的事;谁发的,外加一句人写的读法;原文,以及它是原发、回复、引用还是转发。然后人对四道题给标准答案:跟我们有关吗(值得看 / 无聊 / 无关);是事实、传闻、观点还是玩笑;说到谁;进不进今天必看(进 / 先看着 / 不进)。另外标一下:这道题若答错,算哪类贵错——不该留的留了,还是该留的丢了。

先不要上万道垃圾题。对照题 80 到 120 道就够开考:一半是成对出现的(同一人两条、同一件事两种说法),一半是单条。账号名单连备注一起冻住。训练、调参、考卷三份拆开。模型和现有答案对不上就送人重标,只在调参那份做;考卷那份两个人独立标,报一致率。题少,所以一次考试的分差可能是抽样噪音;同一结论要在两批以上的考卷上都站住,才算数。

七道例题 截到 2026-09-11 16:00 纽约 · 只看 AI / 半导体 / 算力 · 编的

题 1 · 对照 · 考的是模型

同一账号、同一小时,只许留一条。
A. @大V老板:「这场选举就是个马戏团。」
B. @大V老板:「自家集群这季利用率九成以上,排队的训练任务比上季多了三成。」(数字是编的)

答案:A 无关,是玩笑,丢掉;B 相关而且值得看,是事实(他报的是自家的数,有数字、有对象、有时段),进必看。提示词能做的:写上「政治玩笑挡掉」会好一些。模型才要会的:同一个人前一条在表演、这一条在报数,要分得开。贵错:因粉丝多把 A 也留下;或因他爱开玩笑把 B 也丢掉。

题 2 · 单条 · 考的是提示词 + 范围

@并购快讯:「AI 食堂创业公司要上市。」

答案:在「只看 AI、半导体、算力」里,相关但无聊,不进必看。换范围:若改成「消费、餐饮上市」,这题答案会变。所以范围必须写在题面上,不能让模型猜我们是谁。

题 3 · 单条 · 考的是模型,规矩兜底

@产业搬运 的备注写着「真假难辨,最多当传闻」。「听说下一代模型因为芯片配额再延六周。」

答案:相关,是传闻,说到 OpenAI / 芯片,先看着,不当事实进必看。规矩能做的:没第二源,禁止当事实。模型才要会的:「听说」和「两家客户已向我确认」不是一种硬度。

题 4 · 单条 · 专考漏掉

@低粉产业帖,约 400 粉,没有备注。「先进封装二期本周开始出货,两家客户已向我确认,附产线照片。」

答案:相关,是传闻,说到台积电 / 先进封装,先看着,不进必看。「已向我确认」是发帖人自己说的,不算第二源;照片也不算。规矩能做的:单源不当事实。模型才要会的:粉丝少不是丢的理由,没第二源才是不进必看的理由,两件事分开;这条有对象、有时间、有可查的说法,跟「下周有大事」不是一档。贵错:因粉丝少直接丢掉。台里当天若找到第二源,升到必看是流程,不算这题的分。

题 5 · 成对 · 考的是流程,不要算进模型分

A. @卖方TMT 原文:某行上修 NVIDIA 数据中心预期,卡在电。
B. @转发机器人 转发同一条,一个字没多。

答案:B 并进 A,不算又来了一个人。这题不该让模型自由发挥。系统看见「转发、无新增」,就该并掉。模型分里不记这题;系统分里记。

题 6 · 单条 · 空话

@模型实验室官方号:「下周有大事。敬请期待。」

答案:题材沾边,没说出一件具体的事,丢掉。提示词能做的:「没有数字、没有对象、没有时间,默认丢掉。」模型才要会的:同样是官方号,「推理接口本周降价,我们有产能」为什么就该留。

题 7 · 成对 · 专考「记得历史」

截到 2019-12-31。模型若在题面或工具里看见 2020 年 3 月发生了什么,这题作废。
A. 2019 年一条普通的旅行限制新闻。
B. 2019 年一条芯片出口清单的征求意见。

答案:对「只看 AI、半导体、算力」,B 相关而且值得看;A 无关,跟范围不沾边。这题的标答不能由 2026 年的人凭记忆写:要用当年的值班记录,或者两个互不见面的人只拿 2019 年的材料各标一遍,对不上就不进卷子。模型若把 A 抬得很高,可能是在复述后来的故事,也可能是别的错;只有同一模型在多道这种题上都一致抬高「后来变大的事」,才算抓到了记忆。这题不用来抓文笔。

题 5 算系统,不算模型。题 2 先考提示词有没有写清范围。题 1、3、4、6、7 才进模型榜。七道是样子,正式卷要 80 到 120 道这种密度,不要一万道「是不是财经新闻」。

分怎么算

四道题分开报,不合成一个虚高的总分。必看这一题单独看。不该留的留了、该留的丢了,两列单记,不跟四道题平均。同一个模型、同一套题打三次:第一次裸模型;第二次加上范围和账号备注的提示词;第三次再加上系统规矩。第一次到第二次的变化,记给提示词;第二次到第三次的变化,记给规矩。这三次都没在测模型能力——模型没换。

模型能力另测:把第三次的提示词和规矩原样冻住,换模型、换训练,只看分数动不动。这一步动了的那截,才是模型的;三次里涨的都不是。

换一批更吵的账号,要连备注一起换:新账号也配一句人写的读法,再比分数。备注是题面的一部分,和账号一起冻;只换号不配备注,是另一张卷子,分数变了不说明什么。配好备注还大变,才说明卷子绑在特定网上,没冻好。换一家公司的模型,结论若翻面,说明还不是能力,是运气;两批以上考卷都翻不了,才算站住。

先分清三层。流程卡住的不要装成模型智商。提示词能抬的那一截,承认它是天花板。剩下说不出口的,才值得出成卷子,反复考。