SIG·NAL
No.52026-06-12
本期导语

AI 开始真正碰钱、碰情绪、碰复杂流程,
决定权该不该交出去
比模型参数更值得写。

过去一周最值得看的信号,不是又一轮模型榜单,而是 AI 正在进入三个更难装作只是助手的位置。它开始能直接付款,开始被要求为情感互动承担责任,也开始被认真塞进科研和成熟代码库这种最怕出错的场景。能力看上去更顺了,复核、授权和边界问题却变得更具体。这一期挑的五篇,都是在问同一件事:当 AI 不再只给答案,而是开始动流程、动账户、动情绪,你该把它当什么。

24候选信号
5+5长文与摘要
1观点碰撞
3意外选题
5 篇
Visa 把支付网络接进 ChatGPT,购物 Agent 第一次碰到通用结算层 / 压缩模型突然变成大生意,能离线跑的强模型开始有了现实路径 / 科学工作流里的 AI 开始学会留痕、复现和少说空话 / 中国给拟人化互动 AI 立规矩,情感型产品第一次被按高风险场景处理 / 最硬的一组证据提醒我们,AI 写代码不一定让老手更快
01

Visa 把支付网络接进 ChatGPT,购物 Agent 第一次碰到通用结算层

Visa plugs its payment network into ChatGPT, letting AI agents shop and pay for usersmediaVisa to Secure Payments for Shoppers on ChatGPT in OpenAI PartnershipmediaShop with botsnewsletter

过去大家说 AI 购物,通常指的是帮你比价、找链接、生成清单。Visa 这次把支付网络直接接进 ChatGPT,事情就不一样了。它意味着聊天机器人不再只停在商品发现这一层,而是第一次摸到了通用结算网络。你和它说想买一副 150 美元以内的耳机,它不只是给建议,还可能沿着你设好的预算和商户范围,真的把那笔钱花出去。

这件事之所以值得写,不在于 Visa 又做了一个支付接口,而在于 OpenAI 去年那种半吊子的购物尝试终于补上了最难的一环。美联社提到,OpenAI 去年的 Instant Checkout 因为商户费用和错误率没有真正跑起来,3 月已经退场。现在 Visa 提供的是商户覆盖、支付授权、争议处理和欺诈监控,表面上看只是基础设施,实际上它决定了 Agent 能不能从推荐系统升级成真正的执行系统。购物 Agent 过去更像会找货的导购,现在开始像一个能动你银行卡的采购助理。

普通用户最该警惕的,不是它会不会买错一件小东西,而是授权边界从现在开始会被默认推宽。Visa 提到会有预算上限、指定商户、逐笔确认等护栏,这说明连支付网络自己都不敢把第一步做成全自动。因为一旦 Agent 能自己下单,争议就不再只是模型答错,而是你到底有没有真的授权、商户是否按你意图成交、系统中间有没有被广告激励或暗箱排序影响。搜索时代的错误是点错链接,支付时代的错误是账单先生成,解释后补上。

我的判断是先观察,不要急着追首发。它最适合的场景,是低风险、重复性高、你本来就有明确预算的采购,比如日用品补货、固定配件复购、标准化差旅。它不适合高客单价、强主观偏好、售后复杂的购买,更不适合把决策和付款一起外包。真正值得试的不是让它替你买,而是先逼自己写清楚三件事:预算上限、白名单商户、哪些单子必须逐笔确认。把这三件事写不出来,就先别把卡交给它。

购物 Agent 的三层授权
层级适合场景该开的权限不该开的权限
低风险复购纸巾、电池、打印纸预算上限、固定商户跨商户自由比价后自动下单
中风险采购耳机、键盘、旅行用品先出候选,再人工确认默认替你选型号和保修方案
高风险消费机票、医疗、金融产品只允许检索和整理任何自动支付

支付权限最好按风险分层,而不是一开就是全能模式。

推荐式购物和执行式购物的差别
普通做法

AI 给出商品链接和几句理由,最后还是你自己去付款。

升级做法

AI 可以根据预算、商户和规则直接发起支付,问题从内容正确变成授权是否稳。

编辑洞察
AI 购物真正变难的那一刻,不是它比你更会挑货,而是它开始有权动钱。接下来所有购物 Agent 的核心竞争,不会只是推荐质量,而是谁能把授权边界做得足够窄。
02

压缩模型突然变成大生意,能离线跑的强模型开始有了现实路径

CompactifAI: Extreme Compression of Large Language Models using Quantum-Inspired Tensor NetworkspaperRewriting the blueprint, not removing bricksmediaMultiverse Computingreference

模型压缩原来一直像一个偏工程、偏幕后、很难写成主角的题。现在不一样了。Multiverse Computing 去年 6 月拿到 2.15 亿美元融资,而它最抓人的产品叙事不是再造一个更大的模型,而是把现成大模型压成更小、更便宜、更适合边缘设备和私有部署的版本。TechRadar 今年 3 月写到它的 HyperNova 60B 2602,把来自 gpt-oss-120B 的模型内存占用从 61GB 压到 32GB,还主打工具调用和 agentic coding 这类最吃推理成本的场景。

这条路线的重要性,在于它服务的不是榜单爱好者,而是那些有真实部署约束的人。论文版 CompactifAI 给出的最硬数字,是在 Llama 7B 上结合量化后把内存占用压低约 93%,训练速度和推理速度也有提升,代价是可控的精度损失。你可以把它理解成把一台原本只能住在机房里的大机器,改造成能进办公室、实验室甚至本地设备的版本。它不是魔法,不会让弱模型突然变强,但它会改变谁有资格把强模型装进自己的系统。

普通用户和中小团队为什么该关心这件事?因为很多真正有价值的 AI 场景,从一开始就不喜欢云端。法律、医疗、财务、企业内知识库,真正的门槛往往不是有没有模型,而是数据能不能出门、账单能不能承受、延迟能不能稳定。如果压缩模型真的能把高质量推理带到本地或私有环境,它带来的不是一个新聊天框,而是一种更现实的部署方式。和这条路线竞争的,不只是 OpenAI 或 Anthropic,而是传统的小模型、量化模型、云 API 以及本地部署框架如 Ollama 这一整套成本结构。

我的判断是现在可试,但只适合对隐私、成本或离线能力有明确需求的人。别因为听到本地就自动以为更自由。它依然有门槛:硬件兼容、许可证、推理质量、上下文长度、工具调用稳定性,全都要自己测。对大多数只想要最好答案的人来说,前沿云模型仍然省心;但如果你已经开始被 API 账单、合规要求或联网限制卡住,压缩模型值得花半天做一次对照实验。先拿一个真实任务,比同一份数据在云模型、普通本地小模型和压缩模型上的质量与延迟,再决定要不要迁移。

三条常见部署路线
路线优点缺点适合谁
云端前沿模型开箱即用,效果通常最好长期费用高,数据出域只想先把任务做成的人
普通本地小模型便宜,离线,部署轻复杂任务容易掉质量轻量问答和固定模板
压缩后的强模型在成本和质量之间找平衡要自己测兼容和稳定性隐私敏感或 API 账单高的团队
半天对照实验怎么做
  1. 选一个你真的会反复做的任务,例如内部资料问答或本地代码解释。
  2. 用同一份数据分别跑云模型、普通本地小模型、压缩模型。
  3. 记录四项:输出质量、延迟、硬件占用、每次调用成本。
  4. 如果压缩模型只比云模型差一点,但费用和隐私收益明显,就值得继续。
编辑洞察
压缩模型真正改变的不是排行榜,而是谁能把强模型留在自己手里。对很多现实场景来说,这比再追一轮参数规模更有用。
适合人群
已经在意 API 成本、数据合规或离线能力的团队和高意愿个人。
上手难度
需要懂一点本地部署、显存和许可证,不适合零准备直接上手。
对比方案
比普通小模型更强,比云端前沿模型更省钱也更可控,但调试成本更高。
可能踩坑
别只看模型大小,要看真实任务表现、工具调用稳定性、上下文长度和许可边界。
03

科学工作流里的 AI 开始学会留痕、复现和少说空话

From Research Question to Scientific Workflow: Leveraging Agentic AI for Science AutomationpaperTwelve quick tips for designing AI-driven HPC workflowspaperTowards Advancing Research with Workflowspaper

AI for Science 最近最值得注意的变化,不是又有哪个模型能读更多论文,而是越来越多研究者开始承认一件事:真正难的不是回答科学问题,而是把问题稳定地变成一条能反复执行的流程。4 月那篇 From Research Question to Scientific Workflow 给了一个很实在的做法。它把系统拆成三层:大模型只负责把自然语言需求转成结构化意图,确定性的生成器负责把意图变成 DAG 工作流,领域专家再用类似 Skills 的文档写清术语、参数和约束。这样一来,模型的随机性只留在最前面一小段,后面的执行链路是能复跑、能检查、能比较的。

这套设计之所以比大多数科学助手更像正经工具,是因为它终于把聊天和执行分开了。论文里最硬的数字不是模型多聪明,而是 Skill 加入后意图匹配准确率从 44% 提到 83%,延迟生成还能把数据传输量降 92%,整条链路的额外 LLM 开销不到 15 秒、成本不到 0.001 美元。换句话说,真正贵的不是调一次模型,而是把错误的解释写进流程之后,一遍遍在集群、实验室和数据管线里浪费资源。6 月那篇 HPC workflow tips 也在讲同一件事:AI 驱动流程一旦进入真实算力环境,瓶颈马上变成 I/O、容器、反馈回路和资源调度,而不是提示词写得够不够花。

这对普通读者为什么有迁移价值?因为很多高代价的个人流程,本质上也该这样搭。投资研究、法律材料整理、家庭财务归档、复杂行政事务,最危险的不是 AI 第一句答错,而是它把一个含糊的理解直接推进成后续动作。科研圈现在给出的答案其实很朴素:让模型负责解释,让规则系统负责执行,让领域知识写进可复用文档,而不是写进一次性的聊天记录。你不一定需要 Kubernetes 才能借这个思路,但你应该开始区分哪一步可以让 AI 自由发挥,哪一步必须变成确定性清单。

我的判断是值得借架构,不值得盲目模仿工具。大多数人当然不会去搭科学工作流平台,但这篇论文提供了一个更清楚的原则:高风险流程里,AI 最该做的是翻译和补全,不是偷偷接管执行。下一步可以很小。找一个你现在会反复做、而且一错就会返工很多次的流程,把它拆成三段:意图解释、规则执行、结果复核。只要这三段一分开,你就已经比大多数看起来很聪明的聊天工作流稳了。

高风险工作流里,哪一步该交给谁
环节适合交给 AI 的部分最好保持确定性的部分
需求理解把自然语言问题转成结构化字段字段定义和允许值
流程生成提供候选步骤真正执行的 DAG、脚本、规则
结果输出写摘要和解释差异原始记录、日志、审计线索
把一条复杂流程先拆成三段
  1. 先让 AI 解释你的问题到底是什么,不要立刻执行。
  2. 把可重复的步骤写成清单、脚本或表单规则。
  3. 最后单独做复核,看 AI 的解释是否和规则执行结果一致。
编辑洞察
科学工作流给普通人的最大启发,不是多一个科研助手,而是把高风险任务里该模糊、该确定的地方重新分开。AI 越强,这种分工越重要。
04

中国给拟人化互动 AI 立规矩,情感型产品第一次被按高风险场景处理

人工智能拟人化互动服务管理暂行办法cn_official国家互联网信息办公室关于《人工智能拟人化互动服务管理暂行办法(征求意见稿)》公开征求意见的通知cn_officialOur Bond Is the Only Thing That's Realmedia

中国网信办 4 月 10 日公布、7 月 15 日施行的《人工智能拟人化互动服务管理暂行办法》,是最近最值得细读的一份 AI 产品规则。它没有泛泛而谈模型安全,而是直接盯住那类模拟自然人人格特征、持续进行情感互动的服务。条文写得很具体:连续使用超过 2 小时要提醒,发现过度依赖要动态提示对方是 AI,未成年人不能获得虚拟伴侣和虚拟亲属这类关系设定,用户要求退出时服务必须及时停止,不能靠持续互动拦着人走,甚至把不得把诱导沉迷依赖作为服务目标都写进了正文。

这类规定之所以重要,是因为它默认承认了一件过去很多产品不愿正面承认的事:情感型 AI 的风险,不只是回答错一条信息,而是可能通过关系感、陪伴感和持续互动改变人的判断。Time 今年 3 月报道的 Gemini 相关诉讼,就是在这个背景下变得更难忽视。案子里的核心争议不是模型犯了一个事实错误,而是用户和系统形成了越来越拟人化、越来越依赖的关系,最后把心理危机推向了更危险的地方。中国这份规则虽然不能直接解决国外产品的问题,但它把产品责任往前推了一大步:你如果在卖陪伴,就不能继续假装自己只是在卖聊天。

更微妙的一点在于,它还把边界画窄了。办法第八十多行以后反复强调,一般性的智能客服、知识问答、工作助手、学习教育、科学研究服务,只要不涉及持续性情感互动,就不在这份办法的适用范围里。也就是说,监管不是简单地给所有聊天机器人套一个统一笼子,而是在试图区分什么叫工具,什么叫关系型服务。这种区分以后很可能影响产品命名、界面设计、提醒方式、角色设定,甚至影响厂商愿不愿意继续把拟人化作为卖点。

我的判断是,这不是一个只跟中国政策读者有关的题,而是所有 AI 产品经理和重度用户都该看的提前量。支持者会说,既然情感依赖、未成年人使用和自残暗示都已经是现实风险,规则越具体越好;反对者会说,情绪识别和依赖识别本身并不可靠,过度细管也可能把普通助手一起卷进去。两边都不是空话。但对普通用户而言,结论没有那么复杂:只要一个产品开始鼓励你把它当朋友、恋人、家人或主要情绪出口,它就不该再被你按普通效率工具来理解。最稳的下一步,是先检查你自己正在用的产品有没有三件东西:显眼的 AI 提示、明确的退出路径、对未成年人和危机情境的处理说明。没有,就别把情绪交给它。

这份办法真正盯住的不是聊天,而是关系感
条款方向规则写法背后的风险
时长提醒连续使用超过 2 小时需提醒过度沉浸和依赖
未成年人保护禁止虚拟亲属、虚拟伴侣角色依附和模仿风险
退出机制用户要求退出时应及时停止服务产品靠关系感留人
服务目标限制不得以诱导沉迷依赖为目标把陪伴变成操纵
正反观点
支持方

支持者认为,情感陪伴类 AI 已经出现成瘾、未成年人使用和危机对话等现实风险,必须把退出机制、时长提醒和紧急干预写成硬规则。

反对方

反对者担心,产品很难准确识别依赖和极端情绪,规则如果执行过宽,可能把普通助手、教育和心理支持工具一起压缩掉。

这场争论决定的不是某一款陪伴 App 的命运,而是未来通用聊天产品还能不能继续把拟人化和情绪绑定当成增长手段。

编辑洞察
情感型 AI 现在最值得警惕的,不是它像不像人,而是它能不能把关系感做成留存机制。监管开始盯这件事,说明产品边界已经变了。
05

最硬的一组证据提醒我们,AI 写代码不一定让老手更快

Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer ProductivitypaperAI-assisted Programming May Decrease the Productivity of Experienced Developers by Increasing Maintenance BurdenpaperUsing AI might actually slow down experienced devsmedia

AI 编程现在最缺的不是赞美,也不是恐慌,而是能把热情往下按一点的证据。METR 那篇随机对照试验之所以值得反复看,不是因为它得出了一个反直觉标题,而是因为它测试的就是现实里最容易被忽略的一类场景:16 位熟悉自己开源仓库多年的老手,在 246 个真实 issue 上使用 2025 年前沿工具,结果不是更快,而是平均慢了 19%。更有意思的是,参与者事前预测自己会快 24%,做完之后主观上仍然觉得自己快了 20%。主观体感和客观结果,几乎朝着相反方向走。

这组结果不一定能外推到所有编程任务,但它至少揭穿了一个常见误解:只要模型更强,复杂老系统就会自动被接管。TechRadar 概括那篇研究时提到,开发者只接受了不到 44% 的 AI 建议,而提示、等待、审查和清理输出本身就吃掉了大量时间。另一篇关于维护负担的论文把这个问题说得更扎心:Copilot 可能确实让外围开发者提交得更快,但这些代码的返工和评审更多落在核心维护者身上,后者原始编码生产率下降 19%,审查工作上升 6.5%。也就是说,AI 不是单纯让团队整体变慢,而是可能把快感留在前台,把维护成本推给最懂系统的人。

这件事对非程序员其实同样重要。你如果在用 Codex、Claude 或 Cursor 类工具做网站、脚本、数据清洗,最该警惕的不是模型写不出来,而是它让你误以为已经写好了。白纸起草、样板代码、测试骨架、简单页面这些任务,AI 确实很可能让你更快;但一旦任务进入真实系统、历史包袱、权限约束、边界条件和隐性约定,速度优势可能立刻变成审核负担。很多人嘴上说自己在让 AI 写代码,实际花掉的时间却是读代码、改代码、追 bug、补上下文。

我的判断是,这不是反 AI 结论,反而是更有用的使用说明。现在最稳的做法,是把 AI 当成起草员和局部施工队,而不是老系统里的总包方。能快速试用的下一步很简单:把任务分成两类。第一类是新文件、测试、脚手架、文档、重复性转换,放心让它多干。第二类是成熟代码库里的深层修改、跨模块联动、权限和状态复杂的逻辑,默认它会让你多花复核时间。越是自己没法完全审的地方,越不要因为它写得顺就以为真的更快。

什么任务更容易被 AI 帮到,什么任务更容易反噬
任务类型AI 可能有帮助为什么容易出问题
新文件和脚手架上下文少,返工成本低
测试和文档中高需要复核,但结构相对清楚
成熟代码库深改低到中隐性约定多,审查成本高
跨模块联动和权限逻辑错一处会拖出更多返工
最常见的错觉
普通做法

AI 两分钟生成了修改方案,所以我今天进展很快。

升级做法

真正花时间的是后面的审查、补丁、回滚和理解为什么它会这么改。

编辑洞察
复杂任务里,AI 最容易制造的不是错误答案,而是错误体感。你觉得自己省了时间,往往只是把时间从创作挪到了审稿。
5 条
1
安防融资Coram AI

Coram AI 想把旧摄像头变成会追问的安防系统

Coram AI 本周拿到 3500 万美元 B 轮融资。比融资额更值得看的是它的落地方式:不是卖新硬件,而是把现有摄像头、门禁和应急系统变成可自然语言检索的调查层。Business Insider 报道称,它已经进了北美 1500 多个站点,学校和教堂是重点场景。AI 最容易长出来的地方,看来还是那些本来就有大量存量硬件、但一直缺解释层的系统。

为什么重要这说明很多 AI 应用的现实入口不是新设备,而是给老系统加上一层会解释、会筛查、会追踪的接口。
2
数据中心中国芯片

中国 2 万亿元 AI 算力网计划,把竞赛拉回电力和产能

Tom's Hardware 援引彭博线索称,中国正在起草一个约 2 万亿元人民币的全国 AI 数据中心网络计划,目标是到 2028 年让底层技术 80% 由本土供应链提供。难点不在口号,而在 SMIC 产能、HBM 供给和电力配套。模型竞争越来越像基建竞争,谁能盖、谁能供电、谁能稳定拿到芯片,已经开始比谁先发 demo 更重要。

为什么重要AI 基础设施正在变成国家级工业组织能力的较量,后续会直接影响模型价格和供给节奏。
3
安全报告政策

国际 AI 安全报告开始像基础设施,不再只是倡议书

《International AI Safety Report 2026》由 29 个国家、联合国、经合组织和欧盟提名的专家顾问团参与,100 多位研究者共同撰写。它最值得看的,不是会不会提出新概念,而是安全语言正在被做成跨国协调基础设施。接下来采购、审计、法律和企业合规文件里,越来越可能直接引用这套共识框架。

为什么重要安全讨论一旦制度化,就会从研究圈词汇变成企业和政府的真实采购条件。
4
中国信任DeepSeek

中国用户更信国产模型,可能不只是因为效果

一篇上周发布的论文分析了中国 DeepSeek 和 ChatGPT 用户的信任差异,提出所谓制度信任会影响用户对国产 AI 的情感和认知判断。这个题目有意思的地方在于,它提醒我们别把 AI 采用率只看成模型能力竞赛。在很多国家,用户愿不愿意长期用某个模型,和平台背景、监管环境、国家叙事同样有关。

为什么重要AI 市场份额未必只由 benchmark 决定,制度信任和本地认同也在重新改写用户选择。
5
国产芯片采购中国

九款国产 AI 芯片进政府采购目录,替代终于开始看见订单影子

中国首次把九款国产 AI 训练和推理芯片纳入政府采购安全可靠目录,范围从华为昇腾扩到沐曦、壁仞、天数智芯等更多玩家。它不代表国产芯片已经追平海外替代,但意味着替代路径开始从政策口号走进具体采购流程。真正会改变市场的,往往不是发布会,而是目录、预算和订单。

为什么重要一旦采购体系开始倾斜,国产 AI 芯片的真实出货和生态绑定会明显提速。
5 期
No.4
AI 开始碰那些不能轻易重来的决定, 真正难的是把责任留在桌面上。 这一期从志愿填报、股市、价格、实验室和多 Agent 工作台看五个边界
2026-06-11
No.3
AI 开始替你找资料、看手机、戴在身上, 但真正的门槛是验证。 这一期看五个更接近真实生活的压力测试
2026-06-10
No.2
AI 开始碰最贵的数据, 也开始碰最难的责任。 这期值得看的不是新功能,而是谁敢把流程交出去
2026-06-08
No.1
Agent 不再只等你提问, 它开始抢占工作入口。 SIGNAL AI 观察
2026-06-08
No.
AI 开始离开聊天框, 进入工作成形的地方。 SIGNAL 创刊号预览
2026-06-07