本期精选 工具落地 AutoResearch Skill 研究工作流
01
AutoResearch 把“一键写论文”拆成了一组可检查的质量门禁
AutoResearch 前几周最容易传播的说法,是一个人让 Agent 自主写出了数百页论文。这个说法抓眼球,却藏住了可复用的部分。6 月公开的 paper-writing Skill Group 是一套分工明确的流水线:文献检索先追求高召回,再按时效、引用、会议与接收状态评分;写作、实验、图表和模拟审稿交给不同子技能;每轮根据审稿意见返工。读起来像一间小型编辑部的操作手册,比万能提示词具体得多。
作者页面列出的生产统计很夸张:前三篇综述合计 941 条引用、190 页、约 195 万输出 Token,经历约 210 轮迭代。这些都是项目自报数据,自动审稿的 8.5 分也不能当作学术共同体的接收意见。不过,记录至少把成本与过程摊开了。自主写作远非免费按一下按钮;搜索、模型调用、人工规则和多轮失败都要付账。
普通知识工作者无需搬回整套系统,借走几道门就够了。先做来源分层,别把搜索结果前十条当成全貌。成稿前再开一次反方审阅,专门找过度断言、证据缺口和遗漏。最后设停止条件:每轮修改都有具体目标,处理完清单就交付,别让 Agent 在“继续完善”里无限消耗。这套方法也适用于行业报告、产品方案和重要邮件。
这个 Skill 值得读,但“AI 研究员已经成熟”的说法站不住。作者明确写着,公开范围只有 paper-writing 技能组;搜索、API、路由和部署仍有内部依赖,论文质量也要由领域专家核验。公开流程设定的引用核验目标是至少 80%,这也意味着它没有承诺每条引用都已核对。它公开的是厨房动线:备料、质检和返工怎么安排,一目了然。至于菜好不好吃,仍得逐道尝。
还有一个容易漏掉的成本:门禁本身也要被审查。自动审稿人可能共享同一种偏见,评分连续上升也可能只是越来越迎合评分规则。若要把这套方法用于重要报告,最好保留一轮真人检查,专门核对关键数字、原始出处和被系统忽略的反例。
把 AutoResearch 缩成一份普通人可用的四步循环
先宽搜,再把来源分成必须读、补缺口、淘汰三档。 只让第一轮产出结构和证据表,不急着成稿。 另开一次反方审阅,专找过度断言、缺失来源和反例。 只修审阅清单里的问题,达到停止条件就交付。
Skill 与超长提示词的差别
普通做法 把目标、格式、语气和要求一次塞给模型,失败后继续补指令。
升级做法 把检索、写作、审阅、返工拆成独立阶段,每阶段都有输入、输出和验收条件。
编辑洞察
AutoResearch 把质量控制写进了流程。对大多数人,先借走这些门禁,比先搭几十个 Agent 更划算。
上手难度
读懂流程不难,完整复现需要搜索、模型调用和状态管理基础设施。
对比方案
比单次深度研究更透明、更可拆解,但成本和维护远高于普通聊天工具。
可能踩坑
作者自报评分不是同行接收;自动引用也可能错配,最终事实核查不能省。
AI 看病先别急着回答,学会把问题问完整
很多人向 AI 问健康问题时,开场只有一句:“最近头晕,怎么回事?”通用模型往往能列出一串可能性,也会附上一句建议就医。听起来周全,问题却出在更前面:它不知道头晕持续多久、是否突然发生、有没有用药、是否伴随胸痛或肢体无力。资料不完整时,答案写得越流畅,越容易让人误以为已经得到了一次判断。
今年几项研究开始把重点从一次性答题移到多轮对话。ThReadMed-QA 收集了 2437 个真实患者与医生对话线程、8204 组问答,最长 9 轮。结果并不乐观:测试中表现最好的 GPT-5 只有 41.2% 的回答完全正确;一次答错后,后续答错概率会增加 1.9 到 6.1 倍。多轮会补信息,也会传递错误。
另一项研究 MedClarify 尝试用“哪个问题最能减少不确定性”来选择下一问,相比单次回答基线,把诊断错误降低了约 27 个百分点。两个结果放在一起更接近现实:追问本身没有魔法,问题质量和上下文管理才有。真实就诊也不会先出现一份完整病例,医生是在追问中逐步补齐时间线、症状组合和风险信号。
普通用户可以顺势调整目标。把 AI 当成就诊前的整理员,比当诊断员安全得多。让它检查叙述还缺什么:症状何时开始、变化趋势、既往病史、正在使用的药物、已做检查和最担心的问题。最后得到一张沟通清单,而非处方。涉及胸痛、呼吸困难、意识改变、单侧无力等紧急信号时,别再靠对话排查,直接联系当地急救或医疗机构。
产品也要保留每轮信息的来源,允许用户纠正,并把不确定性原样带给医生。模型若在后台悄悄补成一个完整故事,长对话只会让错误更难发现。更有意义的指标是:面对缺失、含糊甚至矛盾的描述时,它能否暂停结论,并把原因说清楚。两项研究目前都是预印本,而且一个数据集来自线上问答,不能直接外推到医院里的临床效果。
把一次性问诊改成信息准备
更安全的就诊前整理提示
请不要诊断或建议我改药。请先检查我的描述缺少哪些关键信息,一次只追问 1—2 个问题;最后把已知事实、未知信息、需要尽快就医的警示信号,以及我要问医生的问题分栏整理。
编辑洞察
医疗 AI 需要学会像谨慎的接诊员那样问。知道何时暂缓结论,本身就是能力。
扩展视野 观点碰撞 VibeThinker 小模型 基准
03
3B 小模型逼近旗舰:基准没有失效,但标题很容易把能力范围抹掉
VibeThinker-3B 的成绩确实漂亮:技术报告给出的 AIME26 分数为 94.3,加入 claim-level test-time scaling 后为 97.1;LiveCodeBench v6 的 Pass@1 为 80.2,并报告在近期未见 LeetCode 竞赛上有 96.1% 接受率。一个 3B 稠密模型进入这一区间,说明课程式监督微调、多领域强化学习和离线自蒸馏,能把数学与代码这类可自动判对错的能力压得很紧。
争议来自媒体标题常见的下一步:把某几项分数接近 Claude、Gemini 或 DeepSeek,缩写成“小模型追平旗舰”。论文其实比标题克制。作者提出的正是“参数压缩—覆盖假说”:可验证推理可能被压进一个很小的能力核心,而开放世界知识、长尾事实和通用任务仍需要更宽的参数覆盖。换句话说,它证明的是专项训练可以很强,不是 3B 模型忽然拥有了旗舰模型的全部经验。
为什么基准仍然有用?因为数学答案和代码测试都能复核,社区也能下载模型、按公开配置重跑。为什么又不能只看榜单?因为训练目标、采样次数、测试时计算量和题目分布会显著改变结果;同一模型在不擅长的开放问答、事实检索、模糊需求和工具协作里,可能完全是另一副样子。把不同模型的一列最高分横向拼起来,也很容易忽略评估设置并不相同。
对用户最实用的结论,是先按任务选模型。你若做可验证的代码补全、数学推理或本地批处理,小模型的成本、速度和隐私优势可能比“全能”更重要;你若需要跨领域研究、最新事实、复杂沟通,就不能用几张数学榜单替代真实试跑。基准没有坏,它只是回答一个窄问题。坏掉的通常是我们把窄答案写成了宽标题。更稳妥的采购办法,是固定一组自己的失败样例,比较成功率、延迟和总成本,而不是每次跟着公开榜单更换模型。
看到小模型追平旗舰时,先核对四件事
编辑洞察
未来更可能出现一组便宜的专项核心;遇到开放问题,再把任务交给知识覆盖更宽的模型。
FDE 走红说明:企业买到模型之后,最贵的工作才刚开始
FDE,Forward Deployed Engineer,最近从一个小圈子岗位变成了 AI 招聘热词。名字像售前工程师,实际更接近“驻场的产品工程师”:跟着客户进入真实环境,找到最值得自动化的流程,把模型接上内部数据和工具,再处理权限、审计、合规、旧系统与上线后的故障。它的工作成果不是一场漂亮演示,而是一条有人愿意每天使用、出错后也有人负责的业务链。
OpenAI 今年成立 Deployment Company,并通过收购 Tomoro 扩充约 150 名部署人员。官方对 FDE 的描述很直接:他们嵌入组织内部,设计、构建、测试并部署连接模型、数据、工具与控制机制的系统。UnitedHealth 6 月发布的招聘也说明,这个角色已经从模型公司扩散到医疗与大型企业。企业不是突然更喜欢“全栈人才”,而是发现采购 API 只解决了能力入口。
这股热潮暴露了 AI 落地里长期被低估的部分。模型能读文档,不等于它有权读公司的文档;能调用工具,不等于能绕过审批;一次试验准确,不等于数据分布变化后仍然可靠。真正耗时的是和业务人员一起定义例外、确定谁能批准、记录每次行动、设计人工接管,并在旧系统里找到可用接口。这些工作很难在总部写一套标准模板后批量复制。
对普通从业者,FDE 的信号也不只是“又多了一个高薪岗位”。它说明未来更值钱的组合能力,是懂业务、能沟通、会做小规模工程验证,并且愿意对上线结果负责。你不必改名叫 FDE,也可以从工作方式开始:挑一个具体流程,画清数据从哪里来、谁有权限、失败时退回哪里,再用 AI 改其中一段。能把模型带过组织摩擦的人,正在比只会比较模型榜单的人更稀缺。对公司而言,也要警惕把所有难题都塞给少数 FDE;真正能规模化的团队,会把一次次驻场经验沉淀成连接器、权限模板和评估集。
一个 FDE 真正交付的五个环节
和一线人员确认高频、昂贵且可衡量的任务。 盘点数据位置、读取权限和敏感字段。 做可回退的小范围原型,而不是直接全自动。 加入审批、审计日志、异常与人工接管。 上线后看使用率、错误类型与业务结果,再决定扩容。
编辑洞察
FDE 走红说明企业终于承认:AI 的最后一公里是一项长期工程,无法靠几个配置项交差。
Curr-0 让机器人边走边整理,但一段演示还不等于通用家务能力
人形机器人演示过去常有一种明显节奏:走到桌前,停稳,重新规划,再伸手抓东西。Curr-0 想去掉这条接缝。Current Robotics 称它是一个全身灵巧操作基础模型,由同一套策略协调 70 多个自由度,让机器人在移动、保持平衡和双手精细操作之间连续切换。官方视频里的任务包括泡茶、整理文件、收拾桌面和物品归位。
公司披露的训练量是 2.1 万小时人类行为数据,其中约 2800 小时为全身示范。架构上,一个系统先学习步态、姿势与身体协调,另一个系统学习手部操作,再在完整数据上联合微调。这个路线反映了具身智能的现实难点:家务不是一只机械手在固定台面上抓标准物,而是身体位置、视野、接触力和双手动作不断互相影响。
不过,演示最容易遮住的也是失败分布。官方页面没有给出覆盖不同家庭、不同光照、陌生物品和连续数小时运行的统一成功率,也没有说明视频中挑选了多少次成功片段。2.1 万小时很大,但数据多样性、遥操作方式和真实机器人数据占比同样重要。WT-UMI 等同期研究还在专门解决接触力采集,说明“碰到东西时知道用了多大力”仍是整个领域的硬问题。
因此 Curr-0 现在值得看的,是动作之间开始接起来,而不是机器人已经会做家务。判断下一轮进展,可以盯三个更朴素的指标:陌生房间里是否仍能完成、连续任务失败后能否自我恢复、同一策略是否能跨机器人身体迁移。机器人视频终于没那么像分镜拍摄了,这是进步;要进入家庭,它还得学会在没有剪辑师时继续工作。家庭环境还会把安全要求抬得更高:玻璃、热水、宠物和突然经过的人,都不是标准测试台上的干净变量。一次动作失败不只扣分,还可能造成真实损失。离普通家庭购买,它仍有明显距离,更适合先看工业与实验场景。
看机器人演示时别只看动作像不像人
编辑洞察
具身智能的分水岭,可能在动作之间的接缝。连续完成任务,比多拍几个高光片段难得多。