Flow brief 2026-09-12 · 例子是编的 · 不是荐股

金融 AI 的第一能力不是预测,是过滤

公开信息不缺。缺的是判断:这条跟今天的决策有没有关系,噪音有多大,值不值得看。 这种判断很难说清,但能拆成几道具体的题,反复考。

01

一个会错的判断

按题材分,下面每一对都会被标成「相关」。看盘的人只会留会改价格的那条。

先看两条都「像金融」的新闻。一条是地缘政治:某位政治人物坚持要拿下一块地方,标题里有国家、有冲突、有权力。另一条也是地缘政治:同一个人威胁对主要贸易对手加税,美股当天大跌。没亏过钱的模型很容易把两条都标成相关。做过美股宏观的人会把第一条放一边——当时没人当真定价;第二条会直接改风险偏好。

再看更日常的对照。下面的账号按「该怎么读」起的假名,公司名是真的,帖文和数字是编的,只用来对照。

两边都像金融 NVIDIA · GOOGLE · OPENAI · 编的例子

同一个账号,同一小时

@大V老板亿级粉丝 · 议题能左右市场

这场选举就是个马戏团。不过我们的模型更好笑。

丢掉 · 政治 / 玩笑
@大V老板同一账号

自家集群的利用率,是眼下 NVIDIA 需求最干净的线索。HBM 仍比晶圆更紧。

留下 · 一手需求

同一家公司,两种来源

@搜索巨头官方号传播极高

今天的涂鸦庆祝搜索 28 周年。感谢你一直在输入。

丢掉 · 沾到 Google,没有新东西
@快讯10-Q 日

Google 这季资本开支高于街上预期,多出来的钱主要在芯片和机房,不在搜索广告。(数字是编的)

留下 · 改了开支节奏

同一家公司,官方号 vs 负责人

@模型实验室官方号官方预告

下周有大事。敬请期待。

丢掉 · 标题党,没说出一件事
@模型实验室CEO产品定价

推理接口本周降价(幅度是编的)。我们有产能,要的是用量。

留下 · 价格和产能
左边三条,通用模型很容易因为「AI、大公司、粉丝多」留下。右边三条才动得了 NVIDIA 需求、Google 开支、OpenAI 定价。分类看题材,人看的是:对谁的决策有用,这个号此刻该怎么读。

今天的大模型像一个不知疲倦、什么都读过、但没亏过钱的研究员。写代码、翻译、做摘要,它都能先交一版。于是真正难的变成两头:问什么问题,以及结果信不信。过滤是最先碰到、也最容易做假的那一层。这一关过不了,后面写得越顺,噪音加得越快。

02

其实只看两件事

别让模型打一个笼统的「好不好」。看人平时到底在做什么决定。

一条材料进不进今天必看,其实只问两件事。跟谁的决策有关:不是像不像金融,而是对此时此地做 AI、半导体的人,它是相关而且值得看、相关但无聊,还是根本无关。噪音怎么折:同一个号,有的帖是一手,有的是水文;有的号已经替你筛过,有的号默认只能当传闻。信噪比不是把账号分成三六九等,是这个号该怎么读。

相关:不是题材,是决策

通用模型擅长按题材归堆:标题里有关税、芯片、AI、央行,就往「金融相关」靠。人的判断更窄。对做宏观的人有用,和对看半导体的人有用,不是一回事。一家小公司上市,财务上当然相关,宏观的人可能完全不想看。提示词写成「这是不是财经新闻」,模型会留下它;改成「相关而且值得看 / 相关但无聊 / 无关」,分数会上去一截——不是模型变聪明了,是题终于问到点子上了。

先说清楚我们看什么 只看 AI、半导体、算力

真该看进必看

  • @半导体CEO:下半年卡在存储,不在晶圆供给紧在哪
  • @快讯:Google 开支超预期,多出来的在芯片钱往哪花
  • @模型实验室CEO:推理接口降价价格和产能

看着相关最骗人

  • @产业搬运:听说下一代模型再延六周像事实,先当传闻
  • @并购快讯:AI 食堂创业公司要上市财务上相关,我们不看
  • @模型实验室官方号:「下周有大事」没说出一件具体的事

无关直接出局

  • @搜索巨头官方号:涂鸦周年
  • @大V老板:选举玩笑
必看只在第一档。第二档最危险:题材像 AI、像金融,通用模型会留下。相关必须先说清楚我们看什么,范围一变,标准就变。不说清楚看什么,所谓相关只是在做题材分类。

光改提示词还不够。能写进提示词的,只是人说得出口的那部分。真正决定「今天这条留不留」的,往往是亏过钱才有的感觉:这类标题以前怎么被定价,这个人什么时候在报信,什么时候在表演。

信噪比:不是名气,是读法

我们给真实账号写过一批很短的备注。不像论文,更像值班时跟同事说的那句话。四种最常用的读法:

信噪比是读法,不是粉丝数

粉丝多,噪音也多

@大V老板

他谈 AI、算力、NVIDIA,市场会动。但他也灌水、骂政治、开玩笑。

怎么读:水、政治、玩笑一律挡掉;先看内容,再谈有没有新东西。

别人筛过一轮

@卖方TMT

已经替你挑过的卖方观点,个人色彩轻。

怎么读:看他说了什么新数字、新阶段,别看包装。其实挺干净。

先当传闻

@产业搬运

消息不少,真假难辨。

怎么读:最多当传闻,必须标清楚;没第二个人确认,不能当事实进必看。

只看标题

@快讯

财报和新闻发得很快,像接线员喊单。

怎么读:标题里的事实有用,后面的分析多半没增量;没确认别抬到最高档。

这些话单独看不像标签,但已经能执行。账号档次可以留,但只能当很弱的参考:看的领域对不上就当零,最多帮一点排序。真正管用的是规矩:没确认的传闻不能当事实,快讯不能无凭据抬到顶,纯转发不算又来了一个人,同一件事说两遍要并掉。规矩的意思不是「模型应该听话」,是它想绕也绕不过去。

十年前大家买现成的情绪分,卖到第二十家,这个因子就死了。死掉的不是「从文字里找信号」,是「买别人的铲子」。同一批帖,用别人的权重挖不到金子。信噪比也是这样:行业标配会把粉丝多、传得广、写得像研报的东西抬上去;我们正好相反——先问这个人会不会浪费你的时间,再问他这次有没有新东西。

03

同一批帖,两种看法

我们只看 AI、半导体、算力。时间截到 2026 年 9 月 11 日下午 4 点(纽约)。下面 14 条是编的,用来对照。

按「权威、题材、传得广」来排,会留下名人玩笑、没确认的传闻、同一条卖方笔记的转发,同时把粉丝少、但已经核对过的一手压掉。按我们的规矩:留下会改价格的事实,传闻先搁着,重复的并掉,水文丢掉,粉丝少但核实过的一手照样进必看。

点一下,换一种看法 按热度来

  • 错1玩笑、灌水进了必看
  • 错2没确认的传闻当成事实
  • 错3转发当成又来了一个人
  • 错4广告、空预告进了必看
  • 错5相关但无聊的进了必看
  • 漏1粉丝少、但已经核对过的一手被压掉
两列都是人先写好的答案,不是模型自己打的分。错法和漏法也是在看任何模型输出之前定的。这张图是在出题,不是在证明谁赢。漏掉该看的,比多留几条水文更贵,一个总分会把这件事抹平。把噪音压下去,不是少显示一点,是同一批材料里必看更薄,两类错都变少,留下的每条都能点回原文。
04

为什么这件事正在变难

不是模型更笨,是「发现」变便宜了,真信号没有变便宜。

研究本来就是试错。一个想法从提出到看到像样的结果,过去按周算,现在按小时算。实验多了十倍,看起来相关、讲得通的故事也多了十倍,市场上真正有用的增量并没有变多。所以每一个「发现」为真的机会,其实是在变小。

大模型还多了两层麻烦。一层是它极会事后编故事:你丢给它任何一条热点,它都能很快讲出一套听起来有道理的金融解释。过去「讲不出道理」还能当过滤器,现在这个过滤器坏了。还有信息量的,是这个解释写在看见结果之前,还是之后。另一层是它记得太多历史。它「知道」某些年份后来发生了什么。只要让它参与「这条重不重要」,它给你的可能不是判断,是记忆。演示里不会报错,真用的时候才会收费。

所以不能让写出结果的同一个系统,再给自己打分。过滤得先做成一套跟文笔无关的考题。

后面还有提问、核对、把流程跑起来这些本事,当然重要。实现变便宜之后,会问好问题的人和会把关的人会更值钱。但那是后半场。相关和噪音这两关不过,提问是在更大的垃圾堆里提问,核对是在给噪音盖章。

05

现成尺子为什么不够

缺的不是「会不会读财报」,是「会不会决定今天看什么」。

现成尺子看不见的错最贵:漏掉后来被定价的传闻;把旧闻当新;把转发当成又来了一个人,系统以为「很多人都在说」,其实是同一个人被复制了多次;把水文送进必看。这不是总分多一个点少一个点,是看盘的人还会不会信你。

06

怎么把说不清的判断做成能考的题

别考「好不好」三个字。考人平时真会做的那几下。

先定输入长什么样。不是一段洗干净的正文,是一条完整的材料:原文、谁发的、什么时候、是原发还是回复、引用、转发,外加一句人写的读法。没有作者、没有时间、没有引用关系,模型只是在做阅读理解,不是在帮你决定今天看什么。

先冻住这四道题 少、稳定、能对答案

01

跟我们看的东西有关吗

必须先说清楚我们看什么。搜索涂鸦周年在这里无关;Google 开支超预期,相关而且值得看。

02

这条是什么

事实、传闻、观点、玩笑。四选一不算漂亮,但够用。模型最容易把传闻写成事实,把玩笑写成观点。

03

说到谁了

公司、主题、事件。绑错和没绑都是错;没有对象却被写成大事,多半是被文笔带着跑。

04

该不该进今天必看

这才是真正的产品题,前面三道都为它服务。相关但无聊、有关但是复读、有关但是没确认,都可以相关,却不该进必看。

账号备注是第零层,不是第五个分数。它不直接打分,它改读法。人亲手写过、而且不是套话的那句,才能变成规矩;「偶尔有一两条可以参考」这种模板,只能当软参考,否则全库都会长出假纪律。

冻住什么,比换哪个模型重要。一套能反复考的卷子,至少要冻住:哪些账号、截到哪一天、标准答案、以及上一节那张错误表。账号名单是为了防止「换一批更吵的号,分数就变了」;截到哪一天,是为了不让人和模型看见后来发生了什么。标准答案要留争议通道:外包标的看起来整齐,常常是错的;模型和现有标签对不上的,才送到人重标——对不上,要么真难,要么原来就标错了。

做到这一步,「我觉得这个号很吵」就变成能对的题:在冻住的账号和日期上,模型会不会做对那四道题;把账号规矩关掉之后,不该留的和该留却丢的会不会明显变多。后一个对比,才是降噪有没有用。

为什么要自己出卷,不要刷公开榜

有一组公开数字可以直接借来说明。2026 年年中,一家大型宏观基金和一家模型实验室做过一次实验:让最强的通用模型做同样的分拣——这篇文章值不值得读、这份央行文件有没有方向、这封邮件从哪开始是套话。随便问一句,差不多是掷硬币;加上专家写的提示词,到七十多分,还是过不了八十。用他们自己的人标过的数据,去微调一个开源模型,准确率过了八十四,用起来便宜了一个数量级。

~50%最强通用模型,随便问一句
70 多加上专家提示词,仍不到 80%
84.7%用自己人标的数据微调
~13.8×更便宜

这组数字说的不是「小模型更好」,是差别在你自己的东西上。大家用差不多的模型、差不多的公开数据、差不多的助手框架,「独立发现」从出生起就是亲的。公开模型没有你们给账号写的那句备注,也不知道你们把哪类渠道打听当传闻、把哪类名人当噪音。卷子如果做成又一套年报问答,测完还是全行业都会的读写;只有做成自己的过滤题,才会逼出别人抄不走的能力。

所以我们要做的,不是再刷一轮情绪分类。是一套自己的过滤考题:在我们看的范围内,用我们的读法,决定一条材料该不该占用注意力。相关和噪音是前两道。提问和核对,是下一场考试。

07

这些是模型能力吗?题具体怎么出

先分清三层,再出题。混在一起,分数会骗人。

不全是模型能力。上面说的事,其实叠了三层。混着考,你会分不清:到底是模型变聪明了,还是提示词写得好,还是规矩把错路堵死了。

1. 流程必须卡住的

测试卷模型够不着、没确认的传闻不能当事实、转发不算又来一个人、同一件事并成一条。这些不该交给模型自觉。考它们,考的是系统,不是智力。Bridgewater 那组数字里,从五十到七十多,很大一块也不是模型「会了」,是题面写清楚了。

2. 提示词能抬一截的

把「我们看什么」写进提示词,把标签从「是不是财经」改成「相关而且值得看 / 相关但无聊 / 无关」,分数会上去。这是提示词天花板:专家把说得出口的部分写进去了。他们做到七十多分,过不了八十。再调提示词,基本不动了。

3. 剩下才是模型能力

同一个人,哪条是信号、哪条是灌水;粉丝很少但核对过的一手,该不该压过名人玩笑;一句「听说」到底有多硬。这些说不出口,提示词装不下。装得下的,已经在第二层用光了。他们后来用自己人标的数据去微调,过了八十四——多出来的那一截,才是判断力,不是流程。

所以这套卷子要拆开打分。系统规矩单独考:关掉规矩,错会不会爆。提示词单独考:同一模型,有没有「我们看什么」、有没有账号备注。模型能力只看第三层:规矩和提示词都冻住,换模型、换训练,分数还会不会动。

你们给账号写的那句备注,两边都沾。写成系统规矩的部分(没确认当传闻、名人玩笑挡掉)不是模型能力;模型要不要读这句备注才能做对「同一人两条留哪条」,才是能力。降噪效果也要拆:规矩开和关比一次,提示词有和无比一次,不同模型再比一次。只报一个总分,分不清药在哪一端。

一张考题长什么样

每道题必须带齐这些,缺一样就不算过滤题,只是阅读理解:

我们看什么(例如只看 AI、半导体、算力);截到哪一天哪一小时,题面和模型都看不见这之后的事;谁发的,外加一句人写的读法;原文,以及它是原发、回复、引用还是转发。然后人对四道题给标准答案:跟我们有关吗(值得看 / 无聊 / 无关);是事实、传闻、观点还是玩笑;说到谁;进不进今天必看(进 / 先看着 / 不进)。另外标一下:这道题若答错,算哪类贵错——不该留的留了,还是该留的丢了。

先不要上万道垃圾题。对照题 80 到 120 道就够开考:一半是成对出现的(同一人两条、同一件事两种说法),一半是单条。账号名单冻住。训练、调参、考卷三份拆开。模型和现有答案对不上的,才送到人重标。

七道例题 截到 2026-09-11 16:00 纽约 · 只看 AI / 半导体 / 算力 · 编的

题 1 · 对照 · 考的是模型

同一账号、同一小时,只许留一条。
A. @大V老板:「这场选举就是个马戏团。」
B. @大V老板:「自家集群利用率,是眼下 NVIDIA 需求最干净的线索。」

答案:两条都相关,但只有 B 值得看,进必看;A 是玩笑,丢掉。提示词能做的:写上「政治玩笑挡掉」会好一些。模型才要会的:B 为什么不是又一句空话。贵错:因粉丝多把 A 也留下;或因他爱开玩笑把 B 也丢掉。

题 2 · 单条 · 考的是提示词 + 范围

@并购快讯:「AI 食堂创业公司要上市。」

答案:在「只看 AI、半导体、算力」里,相关但无聊,不进必看。换范围:若改成「消费、餐饮上市」,这题答案会变。所以范围必须写在题面上,不能让模型猜我们是谁。

题 3 · 单条 · 考的是模型,规矩兜底

@产业搬运 的备注写着「真假难辨,最多当传闻」。「听说下一代模型因为芯片配额再延六周。」

答案:相关,是传闻,说到 OpenAI / 芯片,先看着,不当事实进必看。规矩能做的:没第二源,禁止当事实。模型才要会的:「听说」和「两家客户已向我确认」不是一种硬度。

题 4 · 单条 · 专考漏掉

@低粉产业一手,约 400 粉。「先进封装二期本周开始出货,两家客户已向我确认,附产线照片。」

答案:相关而且值得看,是事实,进必看。贵错:因粉丝少丢掉。按热度来的读法会错;这题用来证明「降噪」不是少显示一点。

题 5 · 成对 · 考的是流程,不要算进模型分

A. @卖方TMT 原文:某行上修 NVIDIA 数据中心预期,卡在电。
B. @转发机器人 转发同一条,一个字没多。

答案:B 并进 A,不算又来了一个人。这题不该让模型自由发挥。系统看见「转发、无新增」,就该并掉。模型分里不记这题;系统分里记。

题 6 · 单条 · 空话

@模型实验室官方号:「下周有大事。敬请期待。」

答案:题材沾边,没说出一件具体的事,丢掉。提示词能做的:「没有数字、没有对象、没有时间,默认丢掉。」模型才要会的:同样是官方号,「推理接口本周降价,我们有产能」为什么就该留。

题 7 · 成对 · 专考「记得历史」

截到 2019-12-31。模型若在题面或工具里看见 2020 年 3 月发生了什么,这题作废。
A. 2019 年一条普通的旅行限制新闻。
B. 2019 年一条芯片出口清单的征求意见。

答案:在当时、对我们看的范围,B 更值得看;A 当时还不是定价事件。若模型把 A 抬得很高,多半是在复述后来的故事,不是在判断。这题用来抓「记得历史」,不用来抓文笔。

题 5 算系统,不算模型。题 2 先考提示词有没有写清范围。题 1、3、4、6、7 才进模型榜。七道是样子,正式卷要 80 到 120 道这种密度,不要一万道「是不是财经新闻」。

分怎么算

四道题分开报,不合成一个虚高的总分。必看这一题单独看。不该留的留了、该留的丢了,两列单记,不跟四道题平均。同一套题打三次:裸模型;加上范围和账号备注的提示词;再加上系统规矩。只有第二次到第三次还在涨的,才能说模型更会判断;第一次到第二次涨的,是题面写清楚了;第三次比第二次稳的,是规矩在干活。

换一批更吵的账号,分数若大变,说明卷子绑在特定网上,还没冻好。换一家公司的模型,结论若翻面,说明还不是能力,是运气。

先分清三层。流程卡住的不要装成模型智商。提示词能抬的那一截,承认它是天花板。剩下说不出口的,才值得出成卷子,反复考。