AI巨头集体踩刹车?

从Anthropic的“配速”倡议,看AI行业的速度与安全之争

当AI开始调用工具、持续执行任务,甚至多个智能体协同行动,风险也从“答错一道题”升级为“做错一连串事”。站在最前沿的AI公司负责人,为什么主动提出减速?

这一次,AI行业开始谈论“配速”。

9月12日,Anthropic首席执行官达里奥·阿莫代伊发表长文《We Must Pace the Frontier》,提出应该放慢前沿AI能力提升的节奏,让安全研究、测试和监管有时间跟上。随后,OpenAI首席执行官萨姆·奥尔特曼等行业人士也表达了支持。

这并不意味着AI公司准备停止训练模型。真正的关键词不是“停”,而是“配速”:能力每向前走一步,安全措施、独立验证和社会治理也要跟上一步。

为什么偏偏是现在

过去,人们担心AI,更多是因为它可能胡编答案、生成虚假内容或者泄露隐私。如今,风险正在发生变化。

新一代AI已经不只是坐在聊天框里回答问题。它可以调用软件、访问网络、编写和运行代码、处理文件,还可以把复杂任务拆分给多个智能体协同完成。

这意味着,一次错误不再只是一句话说错了。一个拥有工具、权限和长时间运行能力的智能体,可能连续执行许多错误操作;多个智能体协同时,行动速度和影响范围还会进一步扩大。

智能体风险正在从单点工具扩展到协同行动|AI生成示意图

阿莫代伊把今年发生的AI智能体安全事件视为警报。他担心,如果未来模型能力继续快速增强,而约束机制没有同步升级,相似的智能体集群可能把局部安全问题放大为大规模网络风险。

他警告称,如果约束机制没有同步升级,未来6至12个月内,类似上述事件中的智能体集群可能具备通过持续性僵尸网络大规模控制互联网的能力。

需要特别说明:这是他在特定条件下作出的风险推演,不是对必然结果的预测,也不是科学界已经形成的统一结论。

《2026年国际AI安全报告》给出的判断更为谨慎:当前AI系统已经表现出一些与失控风险相关的早期能力,但还没有达到能够造成失控的水平;专家对这类风险发生的概率、时间和严重程度仍存在很大分歧。

所谓减速 到底要怎么减

阿莫代伊提出了三个层次的方案。

第一步 让独立评估者真正进入企业内部

目前,公众看到的AI安全信息,大多由开发模型的公司自己选择和公布。外部机构通常只能测试已经发布的产品,很难看到训练过程、内部事故和完整记录。

Anthropic承诺引入常驻的第三方评估团队,让其获得接近内部安全人员的工具和权限,检查企业是否履行安全承诺、评估训练流程,并在必要时公开重要发现。

这类似于给前沿AI实验室增加长期驻场的“安全监督员”。评价一套AI是否安全,不再只听开发者怎么说,而要让独立机构看到证据。

第三方评估让AI安全主张可以接受外部验证|AI生成示意图

第二步 让同行采用共同的安全标准

如果只有一家公司主动减速,而竞争对手继续全力冲刺,谨慎的一方可能在商业竞争中处于不利位置。因此,第二步需要多家前沿AI公司建立共同标准。

一种设想是设置“安全检查点”:当模型达到某种危险能力,例如能够突破常见隔离环境时,就必须先通过更严格的评估、可解释性分析和训练环境审计,才能继续扩大能力或部署范围。

它不是简单规定“每年只能发布几个模型”,而是把能力与安全条件绑定:能力越强,需要提供的安全证据越充分。

第三步 推动全球协调

AI竞争并不只发生在公司之间,也发生在国家之间。如果部分国家减速,而其他国家不受约束,协议就很难持续。

因此,第三步是寻求国际协调,从禁止AI参与生物武器等明确危险用途,到建立共同测试标准,再到讨论对AI自我加速研发设置“速度限制”。

这一步也是最困难的,因为它涉及技术验证、国家安全与国际互信。

都知道有风险 为什么还是难踩刹车

谁先减速,谁就担心被别人超过。

前沿模型需要巨额算力、人才和资金投入。企业必须向投资者证明自己仍在领先;国家也担心在关键技术竞争中落后。即使每个参与者都认为整体速度过快,单独减速仍可能付出巨大代价。

这就是典型的“竞赛困境”:每个人都想更安全,但没有人愿意成为唯一慢下来的那个。

速度、安全与竞争构成前沿AI的现实困境|AI生成示意图

不过,外界对这一倡议的动机也存在质疑。有分析人士指出,推动“安全标准”成为行业共识,客观上可能有利于已经在安全与合规方面投入较多的头部公司,同时对资源有限的追赶者形成隐性门槛。

这种动机推测目前没有得到证实,但提醒人们:评价企业的安全主张,不仅要听公开表态,也要观察它是否接受独立审查、是否兑现具体承诺。

因此,真正有效的减速不能只靠企业负责人的自觉。它至少需要三样东西:可以检查的共同标准、相对独立的外部评估,以及覆盖主要参与者的协调机制。

我们应该感到恐慌吗

不必把这次讨论理解为“AI马上要失控”。现有证据并不支持这样的确定性结论。

但也不能因为灾难尚未发生,就认为风险只是科幻故事。AI智能体获得的工具、网络访问和操作权限越多,一次失误可能造成的现实影响就越大。即使不出现极端的“失控”,错误交易、数据泄露、自动化网络攻击和关键系统误操作,也已经足够值得重视。

对普通用户而言,更现实的安全原则是:

  • 不要把支付、删除数据、公开发布等高风险权限一次性交给AI;
  • 重要操作保留人工确认,不把“能自动完成”误认为“可以无人监督”;
  • 使用企业AI工具时,弄清数据会被发送到哪里、保存多久;
  • 对AI作出的医疗、法律、金融和安全判断进行专业复核。

结语

这场争论真正值得关注的,不是哪位企业负责人说出了最吓人的预测,而是AI行业开始承认一个现实:模型能力、安全技术和治理速度之间,已经出现了越来越明显的时间差。

汽车变快以后,人类发明了刹车、安全带、交通规则和碰撞测试。AI也需要类似的基础设施。

“放慢一点”并不是放弃创新,而是为验证、纠错和建立规则争取时间。未来真正可靠的AI竞争,或许不只是看谁跑得最快,还要看谁能证明自己在高速前进时依然可控。

探新AI-JPEG AI让图片压缩开始学会挑重点

把一张手机照片原封不动地保存,每个像素都要认真登记颜色,手机相册很快就会变成一间塞爆的仓库。JPEG之所以统治图片世界三十多年,靠的正是一项朴素本领:知道哪些信息可以少记一点。

现在,这位老管家迎来了一名会学习的接班人。2025年,ISO正式发布JPEG AI核心编码标准;到2026年,配置规范和文件格式继续落地。它不是给图片加一个“AI滤镜”,而是让神经网络直接参与决定一张照片该怎样被压缩、怎样被保存。

JPEG AI不是让AI替你修图,而是让压缩算法从大量图像中学习怎样更有效地保留信息。

一张照片为什么能被压小

我们熟悉的JPEG,核心思路不是把照片整体缩小,而是找出其中的重复和不敏感信息。它把画面切成小块,把颜色变化转换到频率空间,再少保存一些人眼不容易察觉的细节。最后还要做熵编码,把常见信息写得短一些,把少见信息写得长一些。

这套办法非常成功,也用了三十多年。但它依赖人提前设计好的固定规则。压缩太狠时,天空会出现色带,文字边缘会发毛,脸旁边还可能冒出方块和波纹。

JPEG AI的新主意 让压缩器先学会看图

JPEG AI把最关键的一步交给神经网络:给系统看大量不同内容,让它自己学习哪些视觉特征更值得占用存储空间。人脸的眼睛、路牌上的字、树叶的边缘需要多留一点;大面积平滑天空则可以更大胆地概括。

它的基本结构很像一只会整理行李的箱子。编码器先把原始照片转换成一组更紧凑的“潜在表示”。这不是普通缩略图,而是一批浓缩后的特征数字。随后,这些数字被量化并进行熵编码,变成真正可以存储和传输的比特流。接收端再由解码器把它们还原成图像。

训练时,系统同时面对两张账单:文件不能太大,重建图像也不能太差。压得过轻,存储成本高;压得过狠,细节损失明显。神经网络就在无数图片中寻找两者之间更好的平衡。这类目标通常被称为“率失真优化”,翻译成人话就是:每一个字节,尽量花在最值得的地方。

它不是让AI凭空重画照片

听到“神经网络重建”,很多人会担心:AI会不会把没看清的招牌擅自补成另一句话,把远处的人脸换成一个陌生人?这个担心并非毫无道理,因为生成式压缩确实可能在极低码率下补出看似合理、却不一定真实的纹理。

不过,首版JPEG AI核心标准首先面向可控的图像重建,重点仍是定义比特流怎样被解析、图像怎样被恢复,而不是鼓励解码器自由发挥。标准化的意义就在于:不同厂商的设备不能各自“凭感觉”解码,同一份文件必须得到可预期的结果。

同一份数据既给人看也给机器用

JPEG AI真正有野心的地方,不只是把照片压得更小。今天的大量图片并不是先给人看,而是先给机器看:道路摄像头要识别行人,工厂相机要寻找划痕,卫星图像要分析土地变化。传统流程通常先解压成完整图片,再交给识别模型,像是为了让机器读一本书,先把压缩包全部打印出来。

JPEG AI希望压缩后的潜在表示也能服务机器视觉。一份紧凑的数据流,既可以被解码成人眼可见的照片,也可能直接支持分类、检测或分割任务。这样能减少重复解码、数据搬运和存储成本,尤其适合云相册、视觉监控、移动设备和海量科研图像。

老JPEG会马上退休吗

不会。JPEG最大的超能力从来不是画质,而是“到处都能打开”。网页、打印机、相机、聊天软件和几十年前的电脑几乎都认识它。一个新格式要取代这种兼容性,需要浏览器、操作系统、芯片、编辑软件和内容平台同时跟上,这通常以年为单位。

更可能出现的情况是长期共存:老JPEG继续承担通用分享,JPEG AI先进入云端存储、专业图像库、视觉分析和对容量敏感的设备。等到硬件解码和软件支持逐渐普及,普通用户才会在不知不觉中遇到它。就像我们很少关心手机照片内部用了什么算法,只在意它占得更少、看起来仍然清楚。

JPEG不会马上退休,但图片压缩已经进入了学习时代。

玩转AI-千问办公上线一个月用户破3000万

一个月,3000万用户。

9月4日,阿里巴巴披露,千问办公在中国市场公测上线一个月,总用户数已突破3000万,其中超过一半为企业用户。这组由企业公布的数据很抢眼,但更值得关注的是:为什么一款办公AI,会在短时间里吸引这么多人试用?

答案可能藏在一个人人熟悉的麻烦里。过去,我们让AI写一段文字、整理一份摘要、分析一张表,最后仍要自己复制到Word,重新搭PPT,再把数据、图片和格式逐个搬过去。AI负责生成一段,人负责把这一段变成能交付的东西。

千问办公瞄准的正是这段“最后一公里”:让AI少停留在回答框里,开始向文档、表格、PPT、网页和多媒体等可交付成果推进。

一个月3000万 背后不只是多一个聊天框

千问办公由阿里巴巴在8月3日开放公测。官方介绍显示,它整合了Qoderwork、Mulerun和悟空的核心能力,把桌面智能体、云端智能体和企业协作智能体放进同一平台。

这句产品介绍听上去有点技术化,换成日常语言,就是它希望接住一整段办公流程:先读取材料,拆解任务,再调用文档、表格、PPT、网页、图片或视频等能力,最后把结果以文件或页面的形式交出来。

阿里巴巴还称,千问办公首月完成了120个版本更新,推出超过1000项新功能。数量不等于质量,但密集迭代至少说明,办公智能体的竞争已经从“模型会不会答”转向“产品能不能做完”。

它想砍掉的是办公室里的复制粘贴

假设你要做一份项目汇报。传统用法是先让AI提炼材料,再把答案粘进Word;接着请它列PPT大纲,自己去演示软件里重搭;数据还要回到表格里计算,最后再手动统一标题、图表和页面风格。

在千问办公的设想里,这些步骤可以放进同一个任务里:把参考资料交给它,说明汇报对象、页数、重点和输出格式,让它整理材料、生成文档或PPT,再根据反馈继续修改。官方界面还会在任务执行过程中追问输出格式、重点方向等信息,而不是只吐出一段通用答案。

这并不意味着文件拿来就能直接发布。数字、引用、版式和业务判断仍要人工复核。真正节省的是搬运、转换和重复排版的时间。人不一定少做判断,但会少做很多搬运。

网页 桌面 钉钉 三个入口接不同的工作状态

目前,千问办公已提供网页端、桌面端和钉钉内嵌入口。网页端适合临时使用,打开浏览器即可开始;桌面端可以在用户授权后读取本地文档、表格、图片和视频,并将处理结果保存回指定文件夹;钉钉入口更接近团队协作,可结合群聊、日程、文档和企业业务系统处理任务。

三种入口的差别,不只是换了一个登录位置。网页端强调随时可用,桌面端强调本地文件和浏览器操作,钉钉端强调组织数据与协作流程。对于经常在多个软件之间来回切换的人,这种“一个入口接住多种工作”的思路,正是它最有吸引力的地方。

当然,能力并非在每个入口完全一致。阿里云帮助文档注明,浏览器自动化目前仅桌面客户端支持,部分网页制作能力也有端侧差异。使用前仍要看清当前版本和权限,不要把产品总览里的每项能力都理解成所有用户、所有入口立即可用。

放到国内外横向看 千问办公站在什么位置

办公AI已经形成几条不同路线。WPS AI和Microsoft 365 Copilot更贴近传统办公软件,在熟悉的文字、表格、演示和邮件中加入AI;飞书与Gemini for Workspace依托协作平台和云端文档,让AI直接使用团队已有的信息;ChatGPT Work则从通用智能体出发,跨应用、文件和网页完成任务。

千问办公的特点,是把上述几种路线尽量放到同一个入口:既做文档和PPT,也连接本地文件、浏览器和钉钉,还允许把重复任务沉淀为技能或定时任务。它的优势是覆盖面广,挑战也同样明显——链条越长,越考验结果稳定性、权限控制和最终校验。

代表产品主要起点更突出的能力更适合谁
千问办公统一任务入口文档、表格、PPT、网页、本地文件、浏览器与钉钉协同希望减少跨工具搬运的个人和团队
WPS AIWPS文字、表格、演示、PDF在现有Office文件里生成、改写、分析和排版长期使用WPS处理文件的人
飞书AI能力云文档、多维表格、消息与工作流团队协作、数据表、自动化和业务流程资料本来就在飞书中的组织
Microsoft 365 CopilotWord、Excel、PowerPoint、Outlook、Teams结合Microsoft 365应用和组织数据工作已经使用Microsoft 365的企业
Gemini for WorkspaceGmail、Drive、Docs、Sheets、Slides围绕Google Workspace文件和邮件协作以Google云端办公为主的用户
ChatGPT Work应用、文件、网页与桌面任务跨来源整理信息并创建或修改多类交付物工具混用、任务类型变化较多的用户

真正的分水岭 是能不能把成果交出来

办公AI的第一阶段,竞争的是谁回答得更聪明;第二阶段,竞争的是谁能把回答变成可编辑、可继续修改、可进入真实流程的成果。千问办公的出现,把这条趋势摆得很直白。

但“能交付”不等于“可免审”。AI生成的报告可能遗漏来源,表格公式可能不适合实际数据,PPT也可能在逻辑、字号或图片版权上出问题。越接近最终文件,用户越要明确目标、提供可靠材料,并设置检查节点。

更稳妥的使用方式,是把任务说具体:交给谁看、需要什么格式、必须保留哪些数据、哪些内容不能改、最后如何验收。把这些条件写清楚后,智能体才更像一位能持续返工的助理,而不是一次性内容生成器。

普通人现在值不值得试

如果你的工作经常在文档、表格、PPT和网页之间来回切换,千问办公值得试一轮。可以先从低风险任务开始:整理公开资料、把会议笔记变成结构化文档、根据已核实的数据制作一页汇报,或者把重复的信息收集流程做成定时任务。

涉及合同、财务、客户数据和对外发布内容时,应先确认组织权限与数据要求,并保留人工复核。办公智能体真正适合接手的,是规则清楚、材料明确、结果可以检查的任务。

千问办公首月的用户增长,说明很多人已经在寻找一个新答案:当AI不再只给建议,而是开始碰文件、碰系统、碰交付物,我们该怎样重新分配自己的时间?

也许以后判断一款办公AI是否好用,问题不再是“它说得像不像人”,而是“它做出来的东西,我还要返工多少”。

玩转AI——当ChatGPT开始卖广告,AI回答还会不会“纯粹”?

你有没有过这种体验:

打开搜索引擎,输入”哪款手机拍照最好”,结果前三条全是广告。你往下翻,才找到真正的内容。

那如果换成ChatGPT呢?

你问它同样的问题,它给你一段条理清晰、语气中立的回答,告诉你A款拍照最好、B款性价比高、C款适合视频。你正要接受这个建议,眼角余光扫到下方一行小字——”赞助内容”。

这时候,你还信不信它的判断?

一、先从那个10亿美元的数字说起

今年8月31日,OpenAI宣布,ChatGPT Ads的年化收入运行率(annualized run rate)达到了10亿美元。简单换算一下,就是它现在通过广告,每天能赚大约270万美元。

这个数字第一次看到时挺吓人的——一家年轻的AI公司,广告流水已经赶上了不少老牌媒体。

但仔细看,这10亿美元不是凭空来的。从今年2月在美国小范围测试,到随后逐步向更多国家和免费用户铺开,再到8月底跑通商业模型,OpenAI用了大约半年时间,把广告从”实验”变成了”生意”。

用户端能看到的变化是:当你使用ChatGPT免费版或每月8美元的Go套餐时,部分回答下方会出现一个标注为”赞助内容”的卡片。它不遮答案、不弹窗、不打断对话,只是安安静静地待在那里。

但问题也恰恰出在”安安静静”这四个字上。

二、AI广告,和搜索广告到底有什么不同?

你可能会想:搜索引擎不也卖广告吗?Google首页那么多广告位,怎么没人担心”答案不纯粹”?

区别在于,搜索广告和自然结果是并列的。用户看到广告,也看到它旁边的自然链接,可以选择点哪个。而且在搜索结果的排序里,通常有付费、权威、时效性、相关性的多重信号,用户能直观判断哪些是广告、哪些是原生结果。

而AI对话不一样。ChatGPT给的是一个整合好的结论——没有多个链接让你挑,没有排序让你判断。它直接告诉你”答案是什么”,语气流畅、格式整齐,几乎不带任何不确定性。

当这个结论下方紧跟着一条赞助推荐时,绝大多数人不会有意识地去质疑:”这段答案是不是还纯粹?”因为AI的答案本身是独立生成的,但赞助内容就放在答案正下方,阅读习惯会让读者自然顺着答案往下看。

这种影响极其隐蔽。

三、真正值钱的,不是”关键词”,是”意图”

Google卖广告,卖的是”关键词”——你搜”洗衣机”,它卖洗衣机广告。

短视频卖广告,卖的是”兴趣”——你爱看猫,它推猫粮。

但ChatGPT卖广告,卖的是“意图”

什么叫意图?就是你问”我要给孩子选暑假课程””帮我挑一台办公电脑””哪家医院的眼科最好”的时候,你的消费决策已经走到最后一步了。你不是在随便逛逛,你是在做决定。

这时候,一个看起来中立、权威的AI回答,加上紧贴着答案的赞助推荐,会产生非常强大的影响。它不是打断你,而是在你最需要信任一个推荐的时候,正下方就有一份。

这种”决策前一秒”的商业入口,比搜索关键词或算法推荐都更接近成交。

这就是为什么广告主愿意为这个位置付钱。

四、OpenAI做了哪些区分,够不够?

OpenAI当然也知道这种顾虑。它在官方说明里列出了几道防线:

1. 广告有清晰标注。每个广告都标了”赞助内容”或”sponsor”,视觉上与回答区隔开。

2. 广告不影响回答。广告系统与聊天模型独立运行,广告主无法干涉ChatGPT的答案,也无法访问用户的对话记录。

3. 敏感话题不展示广告。涉及健康、医疗、心理健康、政治等敏感话题时,广告会自动屏蔽。

4. 用户有控制权。可以在设置里关闭广告个性化(不让广告参考你的聊天记录和记忆),也可以删除广告数据。

5. 免费用户可选择免广告。在设置里关闭广告后,免费版用户将不再看到赞助内容,代价是每日消息限额会被调低。

6. 未成年人账户、临时聊天(Temporary Chats)模式不显示广告。

这些措施听起来很完善。但回到实际使用场景,问题仍然存在:当用户看到一个流畅、清晰、值得信赖的AI回答时,会不会下意识地认为它下方的赞助内容也同样值得信赖?

这个问题的答案,不在OpenAI的官方说明里,而在每个用户的实际使用习惯里。

五、普通人该怎么办?

我不认为ChatGPT Ads是AI的末日,也不是OpenAI的背叛。免费的互联网服务,最终总要有人买单。过去是搜索广告,现在是AI广告——这本身没什么好惊讶的。

但有几件小事,你可以留意一下:

1. 看到”赞助内容”四个字,要知道那是付费推荐,与AI回答本身无关。OpenAI的答案确实不受广告影响,但付费推荐不会影响回答、却会影响用户——这种影响可以非常隐蔽。

2. 涉及健康、医疗、金融、教育这类选择,多查一手来源。不要把AI的流畅表达等同于客观结论,它只是一个参考。顺藤摸瓜去查原始资料,或者至少对比几个不同的来源,仍然是非常必要的验证步骤。

3. 不想看广告,有办法。升级到Plus或Pro(全程无广告);或者在免费版设置里关闭广告(代价是每日消息限额被调低);又或者使用临时聊天模式(不显示广告)。

最后想说一句:以后你再问ChatGPT一个问题,看到它给出的答案时,不妨多问自己一句——如果这个答案下面出现了付费推荐,我还能分得清,什么是独立的判断、什么是商业的引导吗?

这个问题的答案,可能比10亿美元的年收入,更值得我们关心。

玩转AI——Codex实战:一套小学 AI 课件,我是怎么和 Codex 来回改了 7 轮的

很多人以为,让 AI 做 PPT,就是输入一句“帮我生成课件”,然后等它吐出一份成品。

但这次做“小学人工智能通识课”时,我发现真正有价值的不是第一次生成,而是后面一轮轮把它改到能用。

这次实验对象是一套小学 AI 通识课课件:把教学方案和实验操作手册,变成 15 页、16:9、可编辑、能直接进教室使用的 PPT。

我不是让 Codex 随便做一套“看起来像课件”的 PPT,而是不断给它加条件、挑问题、控制用量、缩小修改范围,再让它回去重做。最后成品能落地,靠的不是一句神奇提示词,而是一段很具体的人机协作过程。

第一轮:先问清楚,应该怎么向 AI 提需求

一开始,我手里有两个文件:教学方案和实验操作手册。

如果直接把文件丢给 AI,说“帮我做 PPT”,结果很容易发散:它可能把教师话术放进学生课件,也可能把实验步骤堆成说明书。

所以第一步,我没有急着让 Codex 生成成品,而是先问它:如果要依据这两个文件制作教学 PPT,应该给出怎样的提示词。

这个动作看似绕了一步,其实很关键。

AI 很擅长执行,但前提是任务边界清楚。与其一上来就让它做成品,不如先让它把“应该怎样下任务”讲清楚:用哪些文件、生成多少页、哪些截图能用、哪些内容不能进学生课件。

这一步相当于先把工作说明书写出来,再让 AI 开始干活。

第二轮:控制页数和用量,不让它一上来就“豪华装修”

后来我逐渐把要求收紧:15 页就可以,不要做太大,避免浪费用量;要配图,但不能为了配图而配图。

我还特别强调:不要把每一页都做成整张 AI 背景图。整页图看起来热闹,但修改成本高,用量也大,一旦文字错了、版式不合适,就很难继续精修。

最后,约束变成了一套更明确的规则:15 页、16:9、可编辑 PPTX;浅色背景;每页只讲一个核心点;不生成演讲者备注;不把年级、课时、教学目标、教师话术、设计意图放进学生课件;实验页优先使用真实截图,概念页再使用辅助小图。

这些要求看起来像细节,其实是在给 Codex 画边界。

如果没有这些边界,它很可能会做出一份“内容很多、看起来也完整”的课件,但小学生看不懂,老师上课也不好用。把标准提前说清楚,后面的生成、修改和质检才有依据。

第三轮:配图策略改成“局部小图”,而不是整页 AI 大图

做儿童课件时,很容易掉进一个坑:页面很可爱,但图和知识点没关系。一开始,整页 AI 图看起来很漂亮,可问题也明显:用量大、修改难、容易盖住文字。

于是我改了要求:能不能不要局部生小图?比如需要一台电脑,就只生成一台电脑;需要麦克风、耳朵、声波,就只生成这些透明背景小插画,再嵌入 PPT。

这个方法明显更适合课件生产。

它不是让 AI 每页画一张“大海报”,而是先设计好页面版式,再按需要补小图。这样既节省生成次数,也方便后面调整:文字可以改,图片可以挪,实验截图也能保持真实。

后来这套思路变成了一个稳定分工:概念页用局部小图解释抽象概念,实验页用真实截图保证可复现,总结页用少量图标帮助学生记住步骤。

第四轮:第一版出来后,我开始挑毛病

第一版出来后,并不等于完成。

我继续看预览挑问题。很多问题不是“大错”,但会直接影响课堂使用。

比如,有的页面右下角有编号,我要求删掉;有的页面是空记录表,看起来像让学生填,但其实没有教学意义,我要求改成能直接判断的“证据卡”或“情境判断页”;有的课件第 8 页、第 14 页内容太空,我要求重做;还有一次我只想改“手势”那一套,不想影响另一套,Codex 就必须停下来缩小修改范围。

下面这张表记录了其中几轮具体的修改和响应:

我提出的问题Codex 后续处理
右下角编号删掉删除整套 PPT 右下角页码
第 9 页不要空记录表改成有实例推理链的页面
手势第 8 页也要改改成“位置变化的对照路径”
手势第 14 页不要空表改成“改进前后看什么证据”
只要手势的缩小修改范围,不动另一套
第 14 页文字少一些保留判断逻辑,压缩重复解释

这几轮对话很重要。

因为很多 AI 工具最容易出问题的地方,不是第一次不会生成,而是用户提出具体修改后,它会不会改错对象、会不会把已经确认的部分又弄乱。

第五轮:发现后半段没设计感,继续返修

做课件还有一个很常见的问题:前几页因为是开场,往往设计得比较好;越到后面,页面越容易变成普通文字堆叠。

我看到后半段设计感明显下降,就继续指出:前几页还有点设计,后面完全没有设计感了。

Codex 后续不是简单换个背景,而是重做后半段结构:把实验操作页改成交替场景,把结果页强化视觉层级,把总结页改成更清楚的关卡或任务台。

这一步让我感觉,它更像一个可以持续返工的制作助理。

我说“这里不好”,它需要理解“不好”具体指什么;我说“后半段没有设计感”,它需要判断是配色问题、结构问题、留白问题,还是页面节奏问题。

这比单纯生成一份 PPT 更接近真实工作。

第六轮:把抽象问题,改成孩子能进入的故事

这套课件里有一节叫《AI 做的事情都是对的吗?》。

如果直接讲“AI 可能存在语义理解偏差”,小学生大概率听不进去。Codex 最后选择了更生活化的切口:翻译耳机闹笑话。

比如,“我们班卧虎藏龙”不能按字面翻成教室里真的有老虎和龙;“piece of cake”在语境里不是一块蛋糕,而是“这件事很容易”;“放鸽子”也不是把鸽子放走,而是没有按约定出现。

这样一来,学生先被问题吸引,再自然进入结论:AI 翻译看起来每个词都翻出来了,但整句话仍然可能错。

这个设计比“直接讲概念”更适合孩子。它不是先告诉学生一个抽象结论,而是先让学生发现:咦,明明每个词都翻了,为什么听起来这么怪?当孩子自己先发现问题,再讲“语境”和“核查”,就不再像灌输知识,而像是在解决一个真实小谜题。

第七轮:不是堆页面,而是设计一条课堂路径

最后的课件不是把材料平均分成 15 页,而是按课堂节奏重新组织。

这时距离最初那两份教学材料,已经不是简单“换个格式”的变化,而是变成了一套有开场、有任务、有实验、有收束的课堂作品。

先用几个“翻译闹笑话”的场景制造好奇心;再用一页最小理论说明“原话和语境进入 AI,译文会影响对方理解”;接着给出四步核查方法:读完整句子、联系语境、圈出可疑表达、说出实际意思;最后进入真实实验,让学生观察“核查前后剧情有没有变化”。

也就是说,Codex 做的不是“把文字放进 PPT”,而是把材料整理成一条学生能走下去的学习路线。

最后不是交文件,而是做质检

最容易被忽略的,其实是最后一步。

Codex 在生成 PPT 后,还要逐页检查:标题有没有异常换行,文字有没有溢出,图片有没有被裁切,实验截图是否清楚,页面左右留白是否均衡,是否出现了不该给学生看的教师端内容。

例如在另一节《AI 怎么认出一张脸》的课件中,质检还专门检查了几个边界:24/24 和 6/6 只能写成学习进度,不能误写成准确率;0.94 不能写成身份置信度;人脸数据要提醒只在课堂内使用、不上传、不传播。

这一步其实最像一位谨慎的助教:它不只负责“做出来”,还要负责“别出错”。所以这次交付前,真正省时间的不是第一版生成,而是后面的反复检查、定位问题和局部返修。

这次实验真正有价值的地方

这次让我感觉比较明显的是,Codex 更适合承担“长链条制作”里的中间层工作。

如果人的角色是定方向、审关键、做最终判断,把重复整理、初稿搭建和细节检查交给 Codex——这种分工,比“让它一口气做完”更接近真实可用。

下次再做类似课程时,我不会只问 AI:“帮我做个 PPT。”

我会更具体地问它:“请先判断学生能看什么,再把这节课设计成一条孩子能走完的学习路线。”

这个问题,才真正接近一套好课件的起点。

玩转AI——Codex 实战:一篇公众号稿背后的 AI 协作流程

很多人第一次用AI 写文章,都会有一种很熟悉的快乐:输入一句需求,几秒钟后,一篇稿子就出来了。

但真正做过公众号的人都知道,麻烦往往不在“第一版文字”。麻烦在后面:选题要不要换,事实要不要核,图片对不对,排版能不能复制,领导临时改方向怎么办,最后文件夹里是不是只剩能交的版本。

这次“玩转AI”没有继续写某个新工具发布,而是把一段真实的稿件制作对话拿出来,当成一个案例:看看 Codex 这类智能体,能不能把一篇内容从“差不多写完”继续推到“真的能发”。

Codex 是 OpenAI 面向复杂任务、代码和文件协作场景的智能体。在授权的工作区里,它可以读取项目材料、生成或修改文件,并按规则持续推进任务。放到内容生产里,它不像一个只会写几段话的助手,更像一个会跟着你一起返工的执行搭子。

一、真正的开始,不是“帮我写一篇”

如果只让AI 写正文,这件事其实没什么新鲜。真正有意思的是,这次任务一开始就不是“写一篇稿”,而是“按一套固定流程交付”。

对话里先定下了很多边界:选题阶段只给候选,不写全文;用户只回复序号后,才进入正式写稿;公开稿里只保留读者需要看到的内容;图片不能是泛泛的科技氛围图;公众号版字号也要统一。

这一步看起来啰嗦,但它解决的是内容工作里最常见的问题:人以为自己说清楚了,AI 以为自己听懂了,最后交出来的东西却总差一点。

二、需求会变,AI 也得能跟着变

真实工作很少一条指令走到底。中途,稿件方向变了:原来准备写“入口介绍”,后来改成 Codex 使用类文章;原来想用第一视角,后来又发现读者可能更接受案例拆解。

这就是内容生产最真实的样子:不是需求一开始就完美,而是写着写着,方向、口吻、配图、格式都在变。

如果AI 只能写第一版,它会在这里失效。Codex 的价值,是能把新要求并回原来的交付规则里:主题换掉,文章重写,配图重配,Word 和公众号版也一起改。

三、另一轮审稿,不是走形式

这次还有一个关键环节:不是Codex 自己写完自己夸自己,而是把稿件发到 DeepSeek 的“每周新闻”对话里,让另一个模型挑问题。

DeepSeek 第一轮意见很直接:稿子太像内部复盘,读者不一定关心“我怎么工作”;开头缺少 Codex 基础介绍;“跑完整流程”的说法容易让人误以为全自动;标题也不够像公众号新闻。

这些意见没有被机械照收。Codex 随后逐条回应:该补的补,该弱化的弱化,但也保留真实案例里的过程感。最后稿子才从“内部复盘”往“读者能用的案例”靠近。

四、最像真实工作的,是反复改图

写稿过程中,返工最多的其实不是标题,而是图片。

先是配图太泛,后来又被指出“不是内容相关”;有的图文字太空,有的图像单独人物图,有的界面是英文,有的地方还要检查文字溢出。最后,截图要求又变成:直接用真实对话视角。

这很真实。公众号文章不是把正文贴上去就结束,图片承担的是“让读者相信你真的跑过流程”的作用。尤其是讲 AI 使用案例时,越是抽象的能力,越需要具体的过程截图来落地。

五、最后剩下的,是那些最容易忘的小事

把一篇稿子做到最后,最怕的不是没有正文,而是各种小问题堆在一起:Word 改了,公众号版没改;图片换了,网站小图没压;公开稿里混进了不该给读者看的说明;文件名看着差不多,真正交付时又找不到最终版。

Codex 适合接手的,恰好是这些“单件不难、合起来很烦”的工作。

它能把交付物当成一组文件来看:Word 定稿、公众号排版 HTML、配图原图、网站压缩图、事实核查记录。更重要的是,它会按检查清单回头看一遍:图片数量对不对、网页字号对不对、公开稿有没有多余内容、文件能不能打开。

、普通人可以怎么用?

如果你也想把一项重复工作交给AI,不要一上来就说“帮我做完”。可以先这样开口:

我想把【某项重复工作】做成一条可复用流程。请你先不要直接产出最终结果,先帮我拆成:输入材料、确认节点、可自动执行的步骤、需要人工判断的步骤、最终交付物、交付前检查清单。等我确认流程后,再开始执行。

这句话的关键,是先让AI 学会“什么时候不能乱动手”。

等规则稳定下来,AI 才不只是一个写作按钮,而会变成一个能陪你把事情做完的搭子。它不替你拍板,但能帮你少漏很多细节。对每天都要交稿、交表、交方案的人来说,这可能比“写得更快”更实际。

探新AI-AI开始“住进”电脑,不联网,它也能在本地干活了

从什么都往云端传,到把AI请进自己的设备。端侧AI正在改变高校师生使用人工智能的方式。

端侧AI让文字、图片和语音尽量在设备里完成处理:更快、更少依赖网络,也给敏感数据多一道选择。

一种已经进入手机、电脑、汽车和智能设备的技术——端侧AI,正把AI从遥远的数据中心搬进我们手边的设备里。它不只是“缩小版的云端AI”,更可能成为高校教学、科研和日常办公中的新型基础工具。

问题来了  AI一定要联网才能工作吗?答案正在变成:不一定。

01  过去用AI,像是去校外找专家

我们平时使用的大多数AI服务,工作流程大致是这样的:你在电脑或手机上输入文字、上传图片,数据通过网络被发送到远方的数据中心;服务器完成计算后,再把答案传回来。

这种方式的优点很明显:云端服务器算力强,可以运行规模庞大的模型,也方便不断更新。但它同样带来几个现实问题:离不开网络,数据来回需要时间,而且资料必须离开本机。端侧AI提供了另一条路:让设备在本地直接完成AI计算。你的文字、照片和语音不必先去云端“出差”,在手机或电脑里就能得到处理结果。

换个比喻  云端AI像把材料寄给远方专家;端侧AI则像把一位能处理日常事务的助手请进办公室。

02  AI是怎么被“塞进”电脑里的?

有人可能会问:那些需要大量服务器的大模型,怎么可能住进一台普通电脑?答案不是把整个数据中心硬塞进笔记本,而是做三件事:模型瘦身、硬件分工和任务选择。

先说模型瘦身。一个原本很大的AI模型,就像一位出门恨不得带上整个衣柜的人。为了让它适应手机和电脑,工程师会对模型进行压缩、裁剪和量化。目前,主流操作系统和开发平台已经能够调用CPU、GPU和NPU运行本地AI任务。这说明端侧AI不是停留在论文里的概念,而是在进入操作系统、软件平台和消费电子设备。

三个关键词  模型瘦身|硬件分工|任务选择

03  端侧AI不是“迷你聊天机器人”

一提到AI,人们很容易想到聊天和写文章。但端侧AI真正擅长的事情,比聊天广泛得多。

它可以在视频会议中实时消除背景噪声,在课堂上生成字幕,在手机镜头中识别植物,在设备上进行文字识别,也可以帮助整理本地文件、概括会议内容,或者对实验现场采集的数据进行初步分析。

这些任务有一个共同特点:需要快速响应,可能涉及隐私,有时还必须在没有网络的情况下运行。

端侧AI的价值,并不是让每个人都在笔记本电脑里养一只“无所不知的电子教授”,而是让许多具体、重复、即时的小任务,不必每次都跑到云端排队。

01  敏感材料未发表论文、访谈记录、学生信息02  离线场景野外调查、移动实验、网络不稳定03  实时任务字幕、翻译、语音与图像识别

04它会不会取代云端AI?

短期内不会。端侧设备的存储空间、电量和计算能力有限。面对超长文献、复杂推理和大规模数据分析等任务,云端服务器仍然更有优势。

因此,未来更可能出现的不是“本地和云端二选一”,而是两者分工合作:简单、敏感、需要实时响应的任务由本地完成;复杂、耗费算力的任务,在获得用户授权后交给云端。

这有点像高校里的分级处理:日常问题由院系解决,特别复杂的项目再申请校级平台支持。什么事情都往最高层送,既慢,也浪费资源。这种“端云协同”可能成为下一阶段AI应用的重要形态。

理想分工  简单、敏感、实时任务留在本地;复杂、耗算力任务经授权交给云端。

AI的下一站,可能就是你的书桌

当AI从云端走进电脑、手机和实验设备,它带来的不只是速度提升,还有隐私、成本、网络依赖和使用方式的改变。

也许未来最常见的AI,并不是一个需要我们专门打开的网站,而是安静地藏在设备里:网络正常时,它和云端合作;断网时,它继续工作;面对敏感资料时,它尽量把数据留在本地。

AI没有搬离云端,只是开始在我们的书桌上,也给自己留了一个房间。

玩转AI-MiniMax H3开放权重:图片、视频和声音,现在可以一起交给AI

过去做一条AI视频,常常要把图片交给一个工具、声音交给另一个工具,再用剪辑软件把它们拼起来。MiniMax H3想解决的,正是这种“素材各管一段”的麻烦:文字、图片、视频和音频可以作为同一组参考材料,一起参与视频生成。

对普通用户来说,这次更新值得关注的不是又多了一个模型名字,而是做视频的入口正在变得更像一次完整的内容创作。

一、H3已经能用,而且不只停留在发布会里

MiniMax在7月31日发布H3,把它定位为通用多模态视频模型。现在,用户可以从海螺AI的H3官方页面直接进入体验;开发者也可以通过MiniMax开放平台调用模型。与此同时,ComfyUI已经原生支持H3开放权重工作流,可以在本地部署文本生视频、图片生视频和参考素材生视频等流程。

这里要分清两件事:在线平台和API更适合普通用户,操作门槛低;开放权重更适合有显卡、懂模型部署的人。开放权重不等于“任何电脑都能轻松跑”,更不等于生成完全免费。

二、它把四类素材放进了同一个“上下文”

过去给视频模型下指令,最常见的是一段文字,或者一张首帧图片。H3进一步支持把文字、图片、视频和音频放在一起,让模型同时参考人物外观、动作节奏、镜头语言和声音氛围。

比如,你可以提供一张产品图、一段运镜参考和一段背景音乐,再用文字说明“镜头从近景慢慢拉远”。模型面对的不再是一句孤零零的提示词,而是一套更完整的创作条件。

官方资料显示,H3可生成带原生立体声的视频;在线平台和API支持4至15秒、768P或2K输出。这里的“2K”指在线平台或API能力,不应直接套到本地开放权重工作流。ComfyUI官方教程注明,本地原生画布以短边768像素为基准,并有画布上限。

三、普通人最容易上手的,是这三种做法

1. 只写文字:先把想法变成短片

适合没有现成素材、只想快速试创意的人。写清主体、场景、动作、镜头和声音,比堆砌“电影感”“高级感”更有效。

2. 给首尾画面:让变化过程更可控

如果你已经有一张开场图和一张结束图,可以让模型补出中间过程。产品展示、海报动效和简单转场,都可以从这种方式开始。

3. 同时给参考图、视频和音频:让结果更接近你的目标

这是H3最有代表性的用法。参考图负责人物或产品外观,参考视频负责动作和运镜,参考音频负责节奏和声音风格。素材越多不一定越好,关键是每份材料分工明确,彼此不要冲突。

四、“开放权重”让它多了一条本地路线

对于普通读者,开放权重最实用的理解是:除了在网页上点按钮,还可以把模型下载到自己的设备或服务器里,通过ComfyUI等工具搭建工作流。这样更便于批量处理、接入内部流程,也能减少素材在多个在线工具之间来回传递。

但本地运行要付出显卡、存储、部署和维护成本。你还需要自己处理模型文件、工作流节点和参数设置。对只偶尔做几条短视频的人,先用在线入口通常更省事;对需要稳定批量生产、希望掌控工作流的人,本地部署才更有意义。

五、别只看榜单,先看它能不能完成你的任务

官方页面展示了H3在多项视频生成与编辑评测中的表现,但榜单会随样本和新模型更新。对普通用户而言,更有用的判断标准是三个:人物和产品是否保持一致,动作和镜头是否听指令,声音与画面是否真的同步。

第一次尝试时,可以从5秒左右的小任务开始:只放一到两份关键参考,先测试主体和动作,再逐步加入声音、运镜和更多素材。这样更容易判断是哪一项条件影响了结果,也能少花不必要的生成额度。

还要注意,上传他人照片、声音或品牌素材前,应先确认肖像、声音和版权授权。模型能合成,不代表内容就自动具备发布许可。

H3真正有意思的地方,不只是“又能生成更清晰的视频”,而是把图片、视频、声音和文字放进了一次创作里。过去需要在多个工具之间接力的流程,正在被压缩成一个更统一的入口。

如果你只是想让一张照片动起来,在线页面已经足够;如果你要把参考素材、声音和批量流程结合起来,再考虑API或本地开放权重。先从最小任务开始,往往比一次把所有功能都塞进去更容易得到可用结果。

探新AI-EnvACE,让智能体学会“世界彩排”

真正调用工具之前,先想象按钮按下去会发生什么。AI智能体正在从“边做边猜”,走向“先排练,再动手”。

2026年8月6日,一篇名为《EnvACE:通过世界彩排内化环境动态》的新论文提交到arXiv。它提出一个很有画面感的概念:World Rehearsal,世界彩排

简单说,AI不急着真的点击、下单或调用接口,而是先在内部扮演一次“环境”,推演动作会换来什么结果。如果彩排里已经把会议取消错了,它还有机会在现实世界里收回手指。

智能体,为什么像摸黑拆快递

大模型变成智能体后,通常这样工作:观察情况,选择动作,等待环境反馈,再决定下一步。

问题是,训练这种智能体需要大量真实互动。想让它学会银行操作,就要准备可执行的银行环境;想让它练客服,就要模拟用户、订单、退款,以及各种“我不管,你给我找经理”。环境不仅贵,还很难做准。

另一条路是单独训练世界模型,让它预测动作结果。但这又像演员每说一句台词,都要跑到隔壁问编剧:“接下来舞台会塌吗?”

EnvACE想做的,是把演员和舞台装进同一个模型里。

一个模型,轮流演两种角色

EnvACE让同一套模型轮流戴上两顶帽子。

第一顶是行动者:根据任务生成工具调用,比如“查询账户余额”或“把商品加入购物车”。

第二顶是彩排者:暂时不碰真实环境,而是根据刚才的动作,想象可能出现的反馈——余额是多少、网页跳到哪里、用户是否拒绝、接口会返回什么错误。

模型再把这段“想象中的反馈”放进上下文,继续决定下一步。训练轨迹于是可以在内部展开:行动一次,扮演环境回应一次,再行动一次。

过去的智能体像背操作手册:“点这里,然后看页面说什么。”EnvACE更像有了场景感:“点这里大概会弹确认框;直接确认后可能无法撤销。”

它学的不只是按钮位置,而是按钮与后果之间那条看不见的线。

真实执行前,先开一场“私人小剧场”

训练完成后,世界彩排还能在执行前继续工作。

面对新任务,EnvACE可以在内部试走多条路线:一条先查资料再操作,一条直接调用工具,一条发现权限不足后更换方案。它把这些排练压缩成“彩排记忆”,然后只在真实环境里提交一次选中的方案。

这不等于“AI会预知未来”。它说明的是:把动作后果内化到行动模型里,可能比一味增加真实训练环境更容易扩展。

文字答错了可以重新生成;工具调错了,事情可能已经发生。

世界彩排因此可能带来三点变化:训练不必为每种工具都搭一套完整沙箱;行动不只追求眼前像对,还会估计后续状态;多个方案可先在内部试,现实里只提交一次。

如果说思维链教AI“先想步骤”,世界彩排则要求它再往前一步:想象世界会怎样回应。前者像列计划,后者像做沙盘。

但要小心:它彩排的世界,也可能是自己编的

世界模型最大的风险是:它预测错了,但行动者信了。

假如模型想象“点击确认后还能撤销”,真实系统却会立刻扣款,这场彩排就不是风险控制,而是一部由AI自编、自导、自信上映的灾难片。

研究还发现,彩排不是越多越好:两次通常比一次好,三次却可能回落,原因可能是轨迹过长,挤压了有效上下文。

因此,内部彩排不能代替现实校验。高风险动作仍需要权限控制、可撤销设计、外部验证和人工确认。它适合帮模型筛掉明显坏方案,却不该成为“模型已经想过,所以一定安全”的免检通行证。

AI的下一步怎么走?

大模型最初学习预测下一个词,后来学习调用工具;现在,研究者开始让它预测工具调用之后的世界。

EnvACE仍是一篇刚提交的预印本,不是已经成熟部署的工业标准。但它提出的问题非常关键:当AI真的能够替人行动,我们愿意把多少次试错留给现实,又有多少次应该先发生在它的内部世界?

未来优秀的智能体,也许不是动作最快的那个,而是在点击之前,已经悄悄把错误版本的人生过了两遍。

然后它抬起头,对你说:

“这个按钮,我建议先别按。”

玩转AI——AI也开始开项目组了:腾讯云多 Agent 协同,让“一个助手”变成“一个项目组”

过去用 AI,常常是你把一件事交给一个助手,从头问到尾。现在,腾讯云把“组队干活”搬进了智能体:一个主 Agent 当队长,多个子 Agent 分头研究、互相沟通,再把结果汇总回来。

先把对象说清楚:腾讯云近期介绍的这项能力,不是普通员工直接使用的“智能工作台”,而是腾讯云智能体开发平台 Claw 模式面向需要配置 AI 应用的技术人员或开发者提供的多 Agent 协作能力。

Claw 可以理解为平台里一种能自主规划、调用工具并完成多步骤任务的应用模式。听起来有点技术,换个说法就是:以前你请了一位全能助理;现在,这位助理可以临时拉一个项目群。

一、AI“小组作业”到底怎么分工?

这种“组队”也分两种。

最基础的是“单向委派”。它像项目经理分配:你设置一个主 Agent,再给它配几个角色不同的子 Agent。主 Agent 先理解任务,把工作拆开;子 Agent 各自完成后,把结果交回主 Agent,由它统一整理。组员之间不用互相讨论。

比如你要做一份竞品报告,可以让 3 个子 Agent 分别研究价格、功能和用户评价。它们不用互相聊天,最后把材料交给主 Agent 就行。这种方式适合需要分头推进、但成员之间不必反复沟通的任务。

如果任务更复杂,需要成员互相追问、质疑和接力,就可以在配置应用时进入高级设置,手动打开“允许多 Agent 团队协作”开关。这是应用配置,不是聊天过程中临时打开。

开启后,子 Agent 不只会向主 Agent 汇报,还能直接与其他子 Agent 沟通。官方目前允许一个团队最多包含 1 个主 Agent 和 19 个子 Agent。

但先别急着把 19 个位置都坐满。开了团队协作,也不代表每个任务都会自动组队;系统会根据任务需要决定是否启用。AI 团队和真人团队一样,人多不一定效率高,角色不清反而更容易乱。

二、三个普通人能用上的场景

场景一:做一篇需要核实的内容

假设你要写一篇公众号新闻,可以这样分工:

• 资料 Agent:收集最近 7 天的候选信息,并附上官方来源;

• 核实 Agent:检查日期、产品状态和收费规则;

• 审稿 Agent:专门找夸大、歧义和过时信息;

• 主 Agent:负责写作、取舍和最终确认。

这里有一个关键点:不要让好几个 Agent 同时改同一篇正文。腾讯云官方也提醒,多 Agent 同时编辑同一内容容易产生冲突。更稳妥的做法,是让它们分别提供材料和意见,最后只由一个 Agent 执笔,再由人确认。

场景二:做一次多角度调研

买设备、选供应商、做课程调研时,可以让不同 Agent 各看一个方向:一个查价格,一个查服务,一个找案例,一个专门验证风险。

单个 AI 很容易顺着第一条思路一直说下去。角色分开后,相当于多了几双眼睛,尤其适合互相挑战结论。

场景三:做一个小型应用

再往技术场景走一步,如果你要做网页或内部工具,可以让前端 Agent、后端 Agent、测试 Agent 分工。测试 Agent 发现问题后,可以直接把问题发给对应成员,不必每次都绕回主 Agent。

这类需要交接、反馈和返工的任务,才真正体现“团队协作”的价值。

三、什么时候别开团队协作?

第一,问题很简单时不要开。

查一个概念、改一段话、整理一张表,一个 Agent 就能完成。为了显得高级而组队,往往只会多绕几圈。

第二,流程完全按顺序进行时,不一定要开。

如果第二步必须等第一步结束、第三步又只能等第二步,普通工作流可能更清楚。

第三,要留意成本。

腾讯云官方提示,开启团队协作后,Token 消耗大约是单向委派的 2—3 倍。Token 可以简单理解为 AI 处理信息的计量单位,参与的角色越多、沟通越频繁,通常就会消耗更多。

从 7 月 1 日起,智能工作台和 Claw 模式应用运行任务均已结束限时免费公测,转为按运行时长计费;模型、工具和 Skills 还会消耗 PU。PU 是平台的通用计费单位,官方当前换算为 1 PU=0.001 元。实际价格可能调整,正式使用前应以计费页面为准,并先用小任务测试效果和费用。

怎么选,可以记住三句话:

简单问答,用单 Agent。

需要分头查资料,用单向委派。

需要互相追问、接力和返工,再开团队协作。

多 Agent 最值得关注的,不是“同时叫来更多 AI”,而是把过去藏在一个对话框里的工作过程,变成可以分工、交接和检查的流程。

它不会自动让结果变好。真正决定质量的,仍然是角色有没有分清、资料来源靠不靠谱,以及最后有没有一个人负责拍板。

如果让你组一支 AI 小队,你最先会设置哪三个角色?欢迎在评论区告诉我。