这场选举就是个马戏团。不过我们的模型更好笑。
丢掉 · 政治 / 玩笑公开信息不缺。缺的是判断:这条跟今天的决策有没有关系,噪音有多大,值不值得看。 这种判断很难说清,但能拆成几道具体的题,反复考。
按题材分,下面每一对都会被标成「相关」。看盘的人只会留会改价格的那条。
先看两条都「像金融」的新闻。一条是地缘政治:某位政治人物坚持要拿下一块地方,标题里有国家、有冲突、有权力。另一条也是地缘政治:同一个人威胁对主要贸易对手加税,美股当天大跌。没亏过钱的模型很容易把两条都标成相关。做过美股宏观的人会把第一条放一边——当时没人当真定价;第二条会直接改风险偏好。
再看更日常的对照。下面的账号按「该怎么读」起的假名,公司名是真的,帖文和数字是编的,只用来对照。
两边都像金融 NVIDIA · GOOGLE · OPENAI · 编的例子
同一个账号,同一小时
这场选举就是个马戏团。不过我们的模型更好笑。
丢掉 · 政治 / 玩笑自家集群的利用率,是眼下 NVIDIA 需求最干净的线索。HBM 仍比晶圆更紧。
留下 · 一手需求同一家公司,两种来源
今天的涂鸦庆祝搜索 28 周年。感谢你一直在输入。
丢掉 · 沾到 Google,没有新东西Google 这季资本开支高于街上预期,多出来的钱主要在芯片和机房,不在搜索广告。(数字是编的)
留下 · 改了开支节奏同一家公司,官方号 vs 负责人
下周有大事。敬请期待。
丢掉 · 标题党,没说出一件事推理接口本周降价(幅度是编的)。我们有产能,要的是用量。
留下 · 价格和产能今天的大模型像一个不知疲倦、什么都读过、但没亏过钱的研究员。写代码、翻译、做摘要,它都能先交一版。于是真正难的变成两头:问什么问题,以及结果信不信。过滤是最先碰到、也最容易做假的那一层。这一关过不了,后面写得越顺,噪音加得越快。
别让模型打一个笼统的「好不好」。看人平时到底在做什么决定。
一条材料进不进今天必看,其实只问两件事。跟谁的决策有关:不是像不像金融,而是对此时此地做 AI、半导体的人,它是相关而且值得看、相关但无聊,还是根本无关。噪音怎么折:同一个号,有的帖是一手,有的是水文;有的号已经替你筛过,有的号默认只能当传闻。信噪比不是把账号分成三六九等,是这个号该怎么读。
通用模型擅长按题材归堆:标题里有关税、芯片、AI、央行,就往「金融相关」靠。人的判断更窄。对做宏观的人有用,和对看半导体的人有用,不是一回事。一家小公司上市,财务上当然相关,宏观的人可能完全不想看。提示词写成「这是不是财经新闻」,模型会留下它;改成「相关而且值得看 / 相关但无聊 / 无关」,分数会上去一截——不是模型变聪明了,是题终于问到点子上了。
先说清楚我们看什么 只看 AI、半导体、算力
光改提示词还不够。能写进提示词的,只是人说得出口的那部分。真正决定「今天这条留不留」的,往往是亏过钱才有的感觉:这类标题以前怎么被定价,这个人什么时候在报信,什么时候在表演。
我们给真实账号写过一批很短的备注。不像论文,更像值班时跟同事说的那句话。四种最常用的读法:
信噪比是读法,不是粉丝数
他谈 AI、算力、NVIDIA,市场会动。但他也灌水、骂政治、开玩笑。
怎么读:水、政治、玩笑一律挡掉;先看内容,再谈有没有新东西。
已经替你挑过的卖方观点,个人色彩轻。
怎么读:看他说了什么新数字、新阶段,别看包装。其实挺干净。
消息不少,真假难辨。
怎么读:最多当传闻,必须标清楚;没第二个人确认,不能当事实进必看。
财报和新闻发得很快,像接线员喊单。
怎么读:标题里的事实有用,后面的分析多半没增量;没确认别抬到最高档。
十年前大家买现成的情绪分,卖到第二十家,这个因子就死了。死掉的不是「从文字里找信号」,是「买别人的铲子」。同一批帖,用别人的权重挖不到金子。信噪比也是这样:行业标配会把粉丝多、传得广、写得像研报的东西抬上去;我们正好相反——先问这个人会不会浪费你的时间,再问他这次有没有新东西。
我们只看 AI、半导体、算力。时间截到 2026 年 9 月 11 日下午 4 点(纽约)。下面 14 条是编的,用来对照。
按「权威、题材、传得广」来排,会留下名人玩笑、没确认的传闻、同一条卖方笔记的转发,同时把粉丝少、但已经核对过的一手压掉。按我们的规矩:留下会改价格的事实,传闻先搁着,重复的并掉,水文丢掉,粉丝少但核实过的一手照样进必看。
点一下,换一种看法 按热度来
不是模型更笨,是「发现」变便宜了,真信号没有变便宜。
研究本来就是试错。一个想法从提出到看到像样的结果,过去按周算,现在按小时算。实验多了十倍,看起来相关、讲得通的故事也多了十倍,市场上真正有用的增量并没有变多。所以每一个「发现」为真的机会,其实是在变小。
大模型还多了两层麻烦。一层是它极会事后编故事:你丢给它任何一条热点,它都能很快讲出一套听起来有道理的金融解释。过去「讲不出道理」还能当过滤器,现在这个过滤器坏了。还有信息量的,是这个解释写在看见结果之前,还是之后。另一层是它记得太多历史。它「知道」某些年份后来发生了什么。只要让它参与「这条重不重要」,它给你的可能不是判断,是记忆。演示里不会报错,真用的时候才会收费。
所以不能让写出结果的同一个系统,再给自己打分。过滤得先做成一套跟文笔无关的考题。
后面还有提问、核对、把流程跑起来这些本事,当然重要。实现变便宜之后,会问好问题的人和会把关的人会更值钱。但那是后半场。相关和噪音这两关不过,提问是在更大的垃圾堆里提问,核对是在给噪音盖章。
缺的不是「会不会读财报」,是「会不会决定今天看什么」。
现成尺子看不见的错最贵:漏掉后来被定价的传闻;把旧闻当新;把转发当成又来了一个人,系统以为「很多人都在说」,其实是同一个人被复制了多次;把水文送进必看。这不是总分多一个点少一个点,是看盘的人还会不会信你。
别考「好不好」三个字。考人平时真会做的那几下。
先定输入长什么样。不是一段洗干净的正文,是一条完整的材料:原文、谁发的、什么时候、是原发还是回复、引用、转发,外加一句人写的读法。没有作者、没有时间、没有引用关系,模型只是在做阅读理解,不是在帮你决定今天看什么。
先冻住这四道题 少、稳定、能对答案
必须先说清楚我们看什么。搜索涂鸦周年在这里无关;Google 开支超预期,相关而且值得看。
事实、传闻、观点、玩笑。四选一不算漂亮,但够用。模型最容易把传闻写成事实,把玩笑写成观点。
公司、主题、事件。绑错和没绑都是错;没有对象却被写成大事,多半是被文笔带着跑。
这才是真正的产品题,前面三道都为它服务。相关但无聊、有关但是复读、有关但是没确认,都可以相关,却不该进必看。
冻住什么,比换哪个模型重要。一套能反复考的卷子,至少要冻住:哪些账号、截到哪一天、标准答案、以及上一节那张错误表。账号名单是为了防止「换一批更吵的号,分数就变了」;截到哪一天,是为了不让人和模型看见后来发生了什么。标准答案要留争议通道:外包标的看起来整齐,常常是错的;模型和现有标签对不上的,才送到人重标——对不上,要么真难,要么原来就标错了。
做到这一步,「我觉得这个号很吵」就变成能对的题:在冻住的账号和日期上,模型会不会做对那四道题;把账号规矩关掉之后,不该留的和该留却丢的会不会明显变多。后一个对比,才是降噪有没有用。
有一组公开数字可以直接借来说明。2026 年年中,一家大型宏观基金和一家模型实验室做过一次实验:让最强的通用模型做同样的分拣——这篇文章值不值得读、这份央行文件有没有方向、这封邮件从哪开始是套话。随便问一句,差不多是掷硬币;加上专家写的提示词,到七十多分,还是过不了八十。用他们自己的人标过的数据,去微调一个开源模型,准确率过了八十四,用起来便宜了一个数量级。
这组数字说的不是「小模型更好」,是差别在你自己的东西上。大家用差不多的模型、差不多的公开数据、差不多的助手框架,「独立发现」从出生起就是亲的。公开模型没有你们给账号写的那句备注,也不知道你们把哪类渠道打听当传闻、把哪类名人当噪音。卷子如果做成又一套年报问答,测完还是全行业都会的读写;只有做成自己的过滤题,才会逼出别人抄不走的能力。
所以我们要做的,不是再刷一轮情绪分类。是一套自己的过滤考题:在我们看的范围内,用我们的读法,决定一条材料该不该占用注意力。相关和噪音是前两道。提问和核对,是下一场考试。
先分清三层,再出题。混在一起,分数会骗人。
不全是模型能力。上面说的事,其实叠了三层。混着考,你会分不清:到底是模型变聪明了,还是提示词写得好,还是规矩把错路堵死了。
测试卷模型够不着、没确认的传闻不能当事实、转发不算又来一个人、同一件事并成一条。这些不该交给模型自觉。考它们,考的是系统,不是智力。Bridgewater 那组数字里,从五十到七十多,很大一块也不是模型「会了」,是题面写清楚了。
把「我们看什么」写进提示词,把标签从「是不是财经」改成「相关而且值得看 / 相关但无聊 / 无关」,分数会上去。这是提示词天花板:专家把说得出口的部分写进去了。他们做到七十多分,过不了八十。再调提示词,基本不动了。
同一个人,哪条是信号、哪条是灌水;粉丝很少但核对过的一手,该不该压过名人玩笑;一句「听说」到底有多硬。这些说不出口,提示词装不下。装得下的,已经在第二层用光了。他们后来用自己人标的数据去微调,过了八十四——多出来的那一截,才是判断力,不是流程。
所以这套卷子要拆开打分。系统规矩单独考:关掉规矩,错会不会爆。提示词单独考:同一模型,有没有「我们看什么」、有没有账号备注。模型能力只看第三层:规矩和提示词都冻住,换模型、换训练,分数还会不会动。
你们给账号写的那句备注,两边都沾。写成系统规矩的部分(没确认当传闻、名人玩笑挡掉)不是模型能力;模型要不要读这句备注才能做对「同一人两条留哪条」,才是能力。降噪效果也要拆:规矩开和关比一次,提示词有和无比一次,不同模型再比一次。只报一个总分,分不清药在哪一端。
每道题必须带齐这些,缺一样就不算过滤题,只是阅读理解:
我们看什么(例如只看 AI、半导体、算力);截到哪一天哪一小时,题面和模型都看不见这之后的事;谁发的,外加一句人写的读法;原文,以及它是原发、回复、引用还是转发。然后人对四道题给标准答案:跟我们有关吗(值得看 / 无聊 / 无关);是事实、传闻、观点还是玩笑;说到谁;进不进今天必看(进 / 先看着 / 不进)。另外标一下:这道题若答错,算哪类贵错——不该留的留了,还是该留的丢了。
先不要上万道垃圾题。对照题 80 到 120 道就够开考:一半是成对出现的(同一人两条、同一件事两种说法),一半是单条。账号名单冻住。训练、调参、考卷三份拆开。模型和现有答案对不上的,才送到人重标。
七道例题 截到 2026-09-11 16:00 纽约 · 只看 AI / 半导体 / 算力 · 编的
题 1 · 对照 · 考的是模型
同一账号、同一小时,只许留一条。
A. @大V老板:「这场选举就是个马戏团。」
B. @大V老板:「自家集群利用率,是眼下 NVIDIA 需求最干净的线索。」
答案:两条都相关,但只有 B 值得看,进必看;A 是玩笑,丢掉。提示词能做的:写上「政治玩笑挡掉」会好一些。模型才要会的:B 为什么不是又一句空话。贵错:因粉丝多把 A 也留下;或因他爱开玩笑把 B 也丢掉。
题 2 · 单条 · 考的是提示词 + 范围
@并购快讯:「AI 食堂创业公司要上市。」
答案:在「只看 AI、半导体、算力」里,相关但无聊,不进必看。换范围:若改成「消费、餐饮上市」,这题答案会变。所以范围必须写在题面上,不能让模型猜我们是谁。
题 3 · 单条 · 考的是模型,规矩兜底
@产业搬运 的备注写着「真假难辨,最多当传闻」。「听说下一代模型因为芯片配额再延六周。」
答案:相关,是传闻,说到 OpenAI / 芯片,先看着,不当事实进必看。规矩能做的:没第二源,禁止当事实。模型才要会的:「听说」和「两家客户已向我确认」不是一种硬度。
题 4 · 单条 · 专考漏掉
@低粉产业一手,约 400 粉。「先进封装二期本周开始出货,两家客户已向我确认,附产线照片。」
答案:相关而且值得看,是事实,进必看。贵错:因粉丝少丢掉。按热度来的读法会错;这题用来证明「降噪」不是少显示一点。
题 5 · 成对 · 考的是流程,不要算进模型分
A. @卖方TMT 原文:某行上修 NVIDIA 数据中心预期,卡在电。
B. @转发机器人 转发同一条,一个字没多。
答案:B 并进 A,不算又来了一个人。这题不该让模型自由发挥。系统看见「转发、无新增」,就该并掉。模型分里不记这题;系统分里记。
题 6 · 单条 · 空话
@模型实验室官方号:「下周有大事。敬请期待。」
答案:题材沾边,没说出一件具体的事,丢掉。提示词能做的:「没有数字、没有对象、没有时间,默认丢掉。」模型才要会的:同样是官方号,「推理接口本周降价,我们有产能」为什么就该留。
题 7 · 成对 · 专考「记得历史」
截到 2019-12-31。模型若在题面或工具里看见 2020 年 3 月发生了什么,这题作废。
A. 2019 年一条普通的旅行限制新闻。
B. 2019 年一条芯片出口清单的征求意见。
答案:在当时、对我们看的范围,B 更值得看;A 当时还不是定价事件。若模型把 A 抬得很高,多半是在复述后来的故事,不是在判断。这题用来抓「记得历史」,不用来抓文笔。
四道题分开报,不合成一个虚高的总分。必看这一题单独看。不该留的留了、该留的丢了,两列单记,不跟四道题平均。同一套题打三次:裸模型;加上范围和账号备注的提示词;再加上系统规矩。只有第二次到第三次还在涨的,才能说模型更会判断;第一次到第二次涨的,是题面写清楚了;第三次比第二次稳的,是规矩在干活。
换一批更吵的账号,分数若大变,说明卷子绑在特定网上,还没冻好。换一家公司的模型,结论若翻面,说明还不是能力,是运气。