SIG·NAL
No.72026-06-21
本期导语

AI 又答对了几道题,
已经没那么新鲜了
现在要看它能否进入真实、可复核的工作链。

这几天的中文 AI 信息里,有一条很清楚的暗线:行业正在从展示能力,转向修补流程。AutoResearch 把检索、写作和审议拆成可复用的 Skill;医疗模型发现一次性问答远远不够;企业开始高价寻找能把模型塞进权限、数据和旧系统的人。另一边,3B 小模型的漂亮分数和会整理桌面的机器人又提醒我们,演示与通用能力之间仍隔着很长一段路。本期不追最大的数字,追的是那些开始接触真实摩擦的变化。

87中文候选信号
5+5长文与摘要
1观点碰撞
3来源类型
5 篇
AutoResearch 把一键写论文拆成了一组可检查的质量门禁 / AI 看病先别急着回答,学会把问题问完整 / 3B 小模型逼近旗舰:基准没有失效,但标题很容易把能力范围抹掉 / FDE 走红说明企业买到模型之后,最贵的工作才刚开始 / Curr-0 让机器人边走边整理,但一段演示还不等于通用家务能力
01

AutoResearch 把“一键写论文”拆成了一组可检查的质量门禁

刷屏数周后,陈德里的 AutoResearch SKILL 终于开源了media科技论文写作 Skill GroupofficialDeli AutoResearch 论文集与生产统计officialAutoResearch experiments with near-autonomous paper writingmedia

AutoResearch 前几周最容易传播的说法,是一个人让 Agent 自主写出了数百页论文。这个说法抓眼球,却藏住了可复用的部分。6 月公开的 paper-writing Skill Group 是一套分工明确的流水线:文献检索先追求高召回,再按时效、引用、会议与接收状态评分;写作、实验、图表和模拟审稿交给不同子技能;每轮根据审稿意见返工。读起来像一间小型编辑部的操作手册,比万能提示词具体得多。

作者页面列出的生产统计很夸张:前三篇综述合计 941 条引用、190 页、约 195 万输出 Token,经历约 210 轮迭代。这些都是项目自报数据,自动审稿的 8.5 分也不能当作学术共同体的接收意见。不过,记录至少把成本与过程摊开了。自主写作远非免费按一下按钮;搜索、模型调用、人工规则和多轮失败都要付账。

普通知识工作者无需搬回整套系统,借走几道门就够了。先做来源分层,别把搜索结果前十条当成全貌。成稿前再开一次反方审阅,专门找过度断言、证据缺口和遗漏。最后设停止条件:每轮修改都有具体目标,处理完清单就交付,别让 Agent 在“继续完善”里无限消耗。这套方法也适用于行业报告、产品方案和重要邮件。

这个 Skill 值得读,但“AI 研究员已经成熟”的说法站不住。作者明确写着,公开范围只有 paper-writing 技能组;搜索、API、路由和部署仍有内部依赖,论文质量也要由领域专家核验。公开流程设定的引用核验目标是至少 80%,这也意味着它没有承诺每条引用都已核对。它公开的是厨房动线:备料、质检和返工怎么安排,一目了然。至于菜好不好吃,仍得逐道尝。

还有一个容易漏掉的成本:门禁本身也要被审查。自动审稿人可能共享同一种偏见,评分连续上升也可能只是越来越迎合评分规则。若要把这套方法用于重要报告,最好保留一轮真人检查,专门核对关键数字、原始出处和被系统忽略的反例。

把 AutoResearch 缩成一份普通人可用的四步循环
  1. 先宽搜,再把来源分成必须读、补缺口、淘汰三档。
  2. 只让第一轮产出结构和证据表,不急着成稿。
  3. 另开一次反方审阅,专找过度断言、缺失来源和反例。
  4. 只修审阅清单里的问题,达到停止条件就交付。
Skill 与超长提示词的差别
普通做法

把目标、格式、语气和要求一次塞给模型,失败后继续补指令。

升级做法

把检索、写作、审阅、返工拆成独立阶段,每阶段都有输入、输出和验收条件。

编辑洞察
AutoResearch 把质量控制写进了流程。对大多数人,先借走这些门禁,比先搭几十个 Agent 更划算。
适合人群
经常做研究、报告、方案或长文的人。
上手难度
读懂流程不难,完整复现需要搜索、模型调用和状态管理基础设施。
对比方案
比单次深度研究更透明、更可拆解,但成本和维护远高于普通聊天工具。
可能踩坑
作者自报评分不是同行接收;自动引用也可能错配,最终事实核查不能省。
02

AI 看病先别急着回答,学会把问题问完整

AI 看病成为医患新包袱?补上多轮追问mediaThReadMed-QA: Real-World Multi-Turn Medical ThreadsresearchMedClarify: Asking Follow-up Questions by Information GainresearchEvoClinician: Interactive Clinical Reasoningresearch

很多人向 AI 问健康问题时,开场只有一句:“最近头晕,怎么回事?”通用模型往往能列出一串可能性,也会附上一句建议就医。听起来周全,问题却出在更前面:它不知道头晕持续多久、是否突然发生、有没有用药、是否伴随胸痛或肢体无力。资料不完整时,答案写得越流畅,越容易让人误以为已经得到了一次判断。

今年几项研究开始把重点从一次性答题移到多轮对话。ThReadMed-QA 收集了 2437 个真实患者与医生对话线程、8204 组问答,最长 9 轮。结果并不乐观:测试中表现最好的 GPT-5 只有 41.2% 的回答完全正确;一次答错后,后续答错概率会增加 1.9 到 6.1 倍。多轮会补信息,也会传递错误。

另一项研究 MedClarify 尝试用“哪个问题最能减少不确定性”来选择下一问,相比单次回答基线,把诊断错误降低了约 27 个百分点。两个结果放在一起更接近现实:追问本身没有魔法,问题质量和上下文管理才有。真实就诊也不会先出现一份完整病例,医生是在追问中逐步补齐时间线、症状组合和风险信号。

普通用户可以顺势调整目标。把 AI 当成就诊前的整理员,比当诊断员安全得多。让它检查叙述还缺什么:症状何时开始、变化趋势、既往病史、正在使用的药物、已做检查和最担心的问题。最后得到一张沟通清单,而非处方。涉及胸痛、呼吸困难、意识改变、单侧无力等紧急信号时,别再靠对话排查,直接联系当地急救或医疗机构。

产品也要保留每轮信息的来源,允许用户纠正,并把不确定性原样带给医生。模型若在后台悄悄补成一个完整故事,长对话只会让错误更难发现。更有意义的指标是:面对缺失、含糊甚至矛盾的描述时,它能否暂停结论,并把原因说清楚。两项研究目前都是预印本,而且一个数据集来自线上问答,不能直接外推到医院里的临床效果。

把一次性问诊改成信息准备
不要只问先补充让 AI 做什么
我头晕,是什么病?开始时间、持续方式、伴随症状、用药与既往史找缺项并整理给医生的问题
这个检查值高怎么办?单位、参考区间、检查原因、其他相关结果解释术语并列出需要向医生确认的点
能不能停药?药名、剂量、服用原因、开药医生与不适只整理风险和沟通清单,不自行改药
更安全的就诊前整理提示
请不要诊断或建议我改药。请先检查我的描述缺少哪些关键信息,一次只追问 1—2 个问题;最后把已知事实、未知信息、需要尽快就医的警示信号,以及我要问医生的问题分栏整理。
编辑洞察
医疗 AI 需要学会像谨慎的接诊员那样问。知道何时暂缓结论,本身就是能力。
03

3B 小模型逼近旗舰:基准没有失效,但标题很容易把能力范围抹掉

3B 小模型逼近 Claude Opus 4.5:基准坏了,还是后训练太强?mediaVibeThinker-3B Technical ReportresearchWeiboAI/VibeThinkercommunity

VibeThinker-3B 的成绩确实漂亮:技术报告给出的 AIME26 分数为 94.3,加入 claim-level test-time scaling 后为 97.1;LiveCodeBench v6 的 Pass@1 为 80.2,并报告在近期未见 LeetCode 竞赛上有 96.1% 接受率。一个 3B 稠密模型进入这一区间,说明课程式监督微调、多领域强化学习和离线自蒸馏,能把数学与代码这类可自动判对错的能力压得很紧。

争议来自媒体标题常见的下一步:把某几项分数接近 Claude、Gemini 或 DeepSeek,缩写成“小模型追平旗舰”。论文其实比标题克制。作者提出的正是“参数压缩—覆盖假说”:可验证推理可能被压进一个很小的能力核心,而开放世界知识、长尾事实和通用任务仍需要更宽的参数覆盖。换句话说,它证明的是专项训练可以很强,不是 3B 模型忽然拥有了旗舰模型的全部经验。

为什么基准仍然有用?因为数学答案和代码测试都能复核,社区也能下载模型、按公开配置重跑。为什么又不能只看榜单?因为训练目标、采样次数、测试时计算量和题目分布会显著改变结果;同一模型在不擅长的开放问答、事实检索、模糊需求和工具协作里,可能完全是另一副样子。把不同模型的一列最高分横向拼起来,也很容易忽略评估设置并不相同。

对用户最实用的结论,是先按任务选模型。你若做可验证的代码补全、数学推理或本地批处理,小模型的成本、速度和隐私优势可能比“全能”更重要;你若需要跨领域研究、最新事实、复杂沟通,就不能用几张数学榜单替代真实试跑。基准没有坏,它只是回答一个窄问题。坏掉的通常是我们把窄答案写成了宽标题。更稳妥的采购办法,是固定一组自己的失败样例,比较成功率、延迟和总成本,而不是每次跟着公开榜单更换模型。

看到小模型追平旗舰时,先核对四件事
检查项要问的问题
任务范围是数学/代码等可验证任务,还是开放世界任务?
评估预算用了几次采样、多长思维链、多少测试时计算?
可复现性权重、代码、参数和测试集是否公开?
你的任务在自己的 20 个真实样例上是否仍然成立?
正反观点
支持方

反对方

编辑洞察
未来更可能出现一组便宜的专项核心;遇到开放问题,再把任务交给知识覆盖更宽的模型。
04

FDE 走红说明:企业买到模型之后,最贵的工作才刚开始

一文看懂火爆硅谷的 FDE 岗位mediaOpenAI launches the Deployment CompanyofficialWhat Forward Deployed Engineers doofficialForward Deployed Engineer — UnitedHealth Groupcommunity

FDE,Forward Deployed Engineer,最近从一个小圈子岗位变成了 AI 招聘热词。名字像售前工程师,实际更接近“驻场的产品工程师”:跟着客户进入真实环境,找到最值得自动化的流程,把模型接上内部数据和工具,再处理权限、审计、合规、旧系统与上线后的故障。它的工作成果不是一场漂亮演示,而是一条有人愿意每天使用、出错后也有人负责的业务链。

OpenAI 今年成立 Deployment Company,并通过收购 Tomoro 扩充约 150 名部署人员。官方对 FDE 的描述很直接:他们嵌入组织内部,设计、构建、测试并部署连接模型、数据、工具与控制机制的系统。UnitedHealth 6 月发布的招聘也说明,这个角色已经从模型公司扩散到医疗与大型企业。企业不是突然更喜欢“全栈人才”,而是发现采购 API 只解决了能力入口。

这股热潮暴露了 AI 落地里长期被低估的部分。模型能读文档,不等于它有权读公司的文档;能调用工具,不等于能绕过审批;一次试验准确,不等于数据分布变化后仍然可靠。真正耗时的是和业务人员一起定义例外、确定谁能批准、记录每次行动、设计人工接管,并在旧系统里找到可用接口。这些工作很难在总部写一套标准模板后批量复制。

对普通从业者,FDE 的信号也不只是“又多了一个高薪岗位”。它说明未来更值钱的组合能力,是懂业务、能沟通、会做小规模工程验证,并且愿意对上线结果负责。你不必改名叫 FDE,也可以从工作方式开始:挑一个具体流程,画清数据从哪里来、谁有权限、失败时退回哪里,再用 AI 改其中一段。能把模型带过组织摩擦的人,正在比只会比较模型榜单的人更稀缺。对公司而言,也要警惕把所有难题都塞给少数 FDE;真正能规模化的团队,会把一次次驻场经验沉淀成连接器、权限模板和评估集。

一个 FDE 真正交付的五个环节
  1. 和一线人员确认高频、昂贵且可衡量的任务。
  2. 盘点数据位置、读取权限和敏感字段。
  3. 做可回退的小范围原型,而不是直接全自动。
  4. 加入审批、审计日志、异常与人工接管。
  5. 上线后看使用率、错误类型与业务结果,再决定扩容。
编辑洞察
FDE 走红说明企业终于承认:AI 的最后一公里是一项长期工程,无法靠几个配置项交差。
05

Curr-0 让机器人边走边整理,但一段演示还不等于通用家务能力

Current Robotics 发布全身灵巧操作模型 Curr-0mediaCurr-0: A Loco-Dexterous Manipulation ModelofficialWT-UMI: Whole-Body Tactile ManipulationresearchXiaomi Robotics-0official

人形机器人演示过去常有一种明显节奏:走到桌前,停稳,重新规划,再伸手抓东西。Curr-0 想去掉这条接缝。Current Robotics 称它是一个全身灵巧操作基础模型,由同一套策略协调 70 多个自由度,让机器人在移动、保持平衡和双手精细操作之间连续切换。官方视频里的任务包括泡茶、整理文件、收拾桌面和物品归位。

公司披露的训练量是 2.1 万小时人类行为数据,其中约 2800 小时为全身示范。架构上,一个系统先学习步态、姿势与身体协调,另一个系统学习手部操作,再在完整数据上联合微调。这个路线反映了具身智能的现实难点:家务不是一只机械手在固定台面上抓标准物,而是身体位置、视野、接触力和双手动作不断互相影响。

不过,演示最容易遮住的也是失败分布。官方页面没有给出覆盖不同家庭、不同光照、陌生物品和连续数小时运行的统一成功率,也没有说明视频中挑选了多少次成功片段。2.1 万小时很大,但数据多样性、遥操作方式和真实机器人数据占比同样重要。WT-UMI 等同期研究还在专门解决接触力采集,说明“碰到东西时知道用了多大力”仍是整个领域的硬问题。

因此 Curr-0 现在值得看的,是动作之间开始接起来,而不是机器人已经会做家务。判断下一轮进展,可以盯三个更朴素的指标:陌生房间里是否仍能完成、连续任务失败后能否自我恢复、同一策略是否能跨机器人身体迁移。机器人视频终于没那么像分镜拍摄了,这是进步;要进入家庭,它还得学会在没有剪辑师时继续工作。家庭环境还会把安全要求抬得更高:玻璃、热水、宠物和突然经过的人,都不是标准测试台上的干净变量。一次动作失败不只扣分,还可能造成真实损失。离普通家庭购买,它仍有明显距离,更适合先看工业与实验场景。

看机器人演示时别只看动作像不像人
演示里看到还需要追问
能边走边拿换一个房间和桌面还能做吗?
能处理多种物品失败率、重试次数和连续运行时长是多少?
训练数据很多真实机器人、人体示范和合成数据各占多少?
动作很流畅遇到滑落、遮挡和碰撞后能否恢复?
编辑洞察
具身智能的分水岭,可能在动作之间的接缝。连续完成任务,比多拍几个高光片段难得多。
5 条
1
GLM-5.2国产模型Coding

GLM-5.2 把竞争重点放到长程 Coding,而不只是上下文数字

智谱发布并开源 GLM-5.2,宣传重点包括 1M 上下文、Coding Agent 与长程任务,并做了全球限时免费活动。比“又一个百万上下文”更值得看的是,它是否能在跨文件、跨多轮修改后保持目标和测试一致;这个能力要等公开权重、独立复现与真实项目一起验证。

为什么重要国产模型的比较正在从单轮榜单移向能否完成数小时乃至数天的工程任务。
2
微信支付Agent支付权限

微信支付给 Agent 单独办了一张“卡”

微信支付 6 月 17 日发布 AI 专属卡,先接入腾讯 WorkBuddy 的美团生活助手。它放在微信零钱内,让用户为 Agent 的消费设立单独容器,从推荐、下单到扣款形成闭环。比“AI 会付款”更关键的是限额、确认、退款和商户争议最终怎样设计。公开报道暂未给出完整风控细节,现阶段更适合当作小范围产品试验观察。

为什么重要当 Agent 获得花钱权限,最小授权和可撤销性会从安全原则变成产品必需品。
3
中国 AI 应用ARR商业化

中国 AI 应用出现一个“多产品 3 亿 ARR”样本

量子位报道,一家中国 AI 应用公司 ARR 达到 3 亿美元,且收入并非押在单一爆款上。这个信号比下载量更硬,但 ARR 是年化运行收入,不等于已经落袋的全年营收。后续还要看收入确认口径、推理成本、续费和渠道依赖;AI 应用进入经营阶段后,毛利会比排行榜更诚实。

为什么重要中国 AI 应用的评价标准正在从用户量切换到可持续收入与产品组合。
4
SFT训练数据研究

训练数据喂进去了,不代表模型真的学到了

腾讯混元团队在 ACL 2026 工作中提出“不完全学习”:即便样本进入 SFT,模型仍可能漏掉其中一部分模式,报道给出的比例约为 15%。这提醒训练团队,数据清洗之后还要检查覆盖和吸收程度;简单增加样本量,未必能补上模型反复忽略的能力。论文结果仍需结合任务、模型规模和训练设置阅读,不能把 15% 当成通用常数。

为什么重要模型改进的瓶颈可能从“有没有数据”转向“哪些数据始终没有被学进去”。
5
Michael JordanAI 叙事争议

Michael Jordan 反感“思想领袖”替年轻人预告未来

机器学习学者 Michael I. Jordan 批评一些 AI 领袖用确定口吻描述失业、超级智能和人类命运,认为这会给年轻研究者制造无谓的宿命感。他质疑的是预测的确定性:证据还很薄时,行业名望很容易被误当成预见未来的能力。这是一场关于公共表达责任的争论,不是对 AI 风险研究本身的否定。

为什么重要AI 讨论需要把技术证据、商业立场和个人世界观拆开,尤其当叙事开始影响教育与职业选择。
5 期
No.6
AI 不再只等你喂材料, 它开始自己找、自己看、自己踩边界 真正该补的不是新功能,而是判断和护栏。
2026-06-15
No.5
AI 开始真正碰钱、碰情绪、碰复杂流程, 决定权该不该交出去 比模型参数更值得写。
2026-06-12
No.3
AI 开始替你找资料、看手机、戴在身上, 但真正的门槛是验证。 这一期看五个更接近真实生活的压力测试
2026-06-10
No.2
AI 开始碰最贵的数据, 也开始碰最难的责任。 这期值得看的不是新功能,而是谁敢把流程交出去
2026-06-08
No.
AI 开始离开聊天框, 进入工作成形的地方。 SIGNAL 创刊号预览
2026-06-07