玩转-GPT-6一口气上新两款:Sol更强,Luna更快

大模型不再只争“最强”,而是开始为不同任务明确分工

9月22日,OpenAI推出GPT-6 Sol和GPT-6 Luna,与9月3日发布的旗舰模型Astra形成三层分工:Astra继续负责能力上限,Sol和Luna则补齐更实用的两档,一个面向复杂工作,一个面向快速、重复和大批量任务。

如果说Astra代表“把能力上限推到最高”,那么Sol和Luna更像是把这套能力带进日常工作。OpenAI给出的方向很明确:大多数人不需要每次都调用最昂贵、最强大的模型,而是需要一个能在质量、速度和成本之间做出合适选择的AI系统。

GPT-6开始像一个分工明确的团队

GPT-6家族现在形成了三层结构。Astra负责最困难、最开放的问题,例如复杂研究、跨软件操作和高难度工程任务;Sol面向编程、智能体和需要判断力的日常工作;Luna则针对边界清晰、数量庞大、需要快速完成的任务。

这种设计很像一个团队:最复杂的决策交给资深专家,重要但高频的工作交给主力成员,规则明确的批量任务则交给执行速度更快的成员。目标不是让所有任务都使用同一颗“大脑”,而是把合适的能力放到合适的位置。

Sol是日常主力,重点在复杂工作

OpenAI将Sol定位为复杂编程和智能体工作流的主力模型。它不仅能回答问题,还能调用搜索、文件、代码解释器、终端、电脑操作和MCP等工具,适合处理需要连续执行多个步骤的任务。

Sol支持文字和图片输入,拥有105万Token上下文窗口,单次最多可输出12.8万Token。从规格上看,它可以一次容纳大型代码库、长篇报告或大量项目资料,为后续修改、检查和交付提供更完整的上下文。

更值得注意的是,它支持从“无需深度思考”到更高强度推理的多档设置。面对简单修改时可以快速执行,遇到复杂规划、调试或研究任务时再增加推理投入,不必让每个问题都以最高成本运行。

Luna不是“缩水版”,而是批量工作的效率工具

Luna同样拥有105万Token上下文和完整的工具能力,但定位更偏向聚焦、重复、高频。例如资料分类、信息提取、批量检查、固定格式写作、客服分流和自动化流程,都不一定需要旗舰模型从头深度推理。

在这些场景里,真正重要的是响应快、成本低、能够稳定重复。单次任务节省一点看起来不多,但当企业每天要执行几万甚至几十万次调用时,差距会迅速放大。

新模型的重点,不只是单价下降

按照OpenAI公布的信息,Sol和Luna改进了缓存与推理效率,相比GPT-5.6同期促销定价降低约一半。API标准计费中,Sol每百万Token输入为2美元、输出为10美元;Luna输入为0.1美元、输出为0.5美元。

但这次更新真正重要的,不是简单地“便宜了”。当模型能够根据任务难度进行分工,AI产品就不必在质量和成本之间二选一:复杂环节交给Sol,明确的小任务交给Luna,最困难的工作再升级到Astra。

这会直接影响AI产品的设计。未来一个自动化系统可能同时使用多种模型:Luna先整理材料、筛选任务,Sol负责分析和执行,只有极少数高难度问题才交给Astra。用户看到的是一个完整助手,背后却是一支按需协作的模型团队。

普通用户什么时候能用到?

Sol和Luna已经进入API,并在ChatGPT Work和Codex中向符合条件的Plus、Pro、Business、Enterprise和Edu用户推出。免费版和Go用户可以在ChatGPT桌面应用中交互式体验Luna,但这不等同于获得免费API额度,程序化调用仍按Token计费。

需要区分的是,它们目前主要服务于Work和Codex,并不是普通Chat聊天界面中同名模型的简单替换。不同账户能够看到的模型、用量和工具也可能有所不同。

大模型竞争正在从“谁有一个最强模型”,转向“谁能让不同模型像团队一样分工”。

模型价格、开放范围和使用额度可能随产品与账户类型调整。实际选择时,不应只看单次Token价格,还要结合任务成功率、运行时间、工具调用次数和人工复核成本。

GPT-6 Sol和Luna释放的信号很清楚:AI走向大规模使用后,最强并不是唯一答案。能够用合适的能力、合适的速度和合适的成本,把任务稳定做完,才是下一阶段真正的竞争力。

玩转AI-DeepSeek-V4.1-Flash来了:更快、更省,还超过Pro?

大模型竞争,开始从“堆参数”转向“省内存、提效率”

DeepSeek最近发布了V4.1-Flash。名字里虽然有“Flash”,但它并不是简单的轻量版:按照官方测试,新模型在多项任务上已经追平甚至超过V4-Pro,同时速度更快、运行成本更低。

过去的大模型升级,常常围绕一个字:大。参数更多、训练数据更多、算力投入更高。但V4.1-Flash带来的新信号是,模型不一定要在每一步都“全力运转”。如果能重新安排计算方式,同样的任务也可以做得更省。

它不是单纯“变小”,而是换了一种工作方式

V4.1-Flash是一款5520亿参数的混合专家模型,支持文字和图片输入,最长可处理100万Token的上下文。它可以阅读长文档、分析图表,也能参与需要连续操作的智能体任务。

真正特别的是它采用了新的非对称结构:读取输入时只激活约80亿参数,生成回答时激活约160亿参数。简单理解,就是先用较少资源快速读懂材料,再把更多算力集中到回答阶段。

这很像处理一份很长的报告:浏览和整理资料时不必动用整个专家团队,到了分析和形成结论时,再让更多专家参与。模型的总参数仍然很大,但每一步真正参与工作的参数少得多,因此可以兼顾能力与效率。

能力提升,重点落在“能办事”

从DeepSeek公布的测试看,V4.1-Flash的提升并不只体现在回答问题。它在编程、终端操作、网络安全和办公自动化等Agent任务中表现突出。

例如,在测试软件工程能力的DeepSWE v1.1中,V4.1-Flash取得74.2%的通过率;在Automation-Bench中取得54.8%。这类测试关注的不是模型会不会背知识,而是它能否理解目标、调用工具、处理错误,并把一串步骤真正执行完。

DeepSeek还表示,新模型在知识、推理和代码能力上接近或超过V4-Pro。不过,这些成绩主要来自官方提供的测试环境,不同模型使用的工具、推理预算和运行方式可能并不完全相同,因此更适合看作能力方向,而不是简单的“总冠军排名”。

省下来的,主要是AI的“工作记忆”

长文档和复杂智能体任务会不断积累上下文。模型为了记住前面的内容,需要保存一套名为KV Cache的缓存,就像在桌面上摊开越来越多的工作笔记。

普通聊天只有几轮,笔记不算多;但智能体可能持续工作几十分钟甚至更久,还要阅读文件、观察界面、调用软件并检查结果。任务越长,需要保留的“工作记忆”就越多。缓存逐渐成为速度、并发量和成本的重要瓶颈。

DeepSeek称,V4.1-Flash所需的显存缓存约为上一代的四分之一,需要长期保存到SSD或主机内存的缓存约为八分之一。与DeepSeek第一代模型相比,每个Token所需的全局KV Cache已经缩小约437倍。

这意味着同样的硬件可以同时承载更多任务,长对话和长流程不必为了“记住前文”付出过高代价。对于真正大规模部署AI的企业来说,这种节省可能比跑分提高几个百分点更有价值。

对使用者来说,最直接的是更快、更便宜

新模型已经上线DeepSeek API,并取代旧版V4-Flash。DeepSeek还宣布,在V4.1-Pro推出前,原V4-Pro请求将暂时转到V4.1-Flash,并按Flash价格计费。

根据官方价格表,闲时缓存命中的输入价格为每百万Token 0.02元,未命中为1元,输出为4元;高峰时段价格翻倍。普通用户未必会直接计算Token,但更低的调用成本会影响AI产品能否提供更长的上下文、更多次工具调用,以及更复杂的自动化功能。

对于开发者和企业,V4.1-Flash的吸引力不只是“单次回答便宜”。当一个智能体每天执行成千上万次任务,缓存、响应速度和并发能力都会被放大。模型每节省一点资源,最后都可能变成真实的服务器成本和产品体验。

这背后的信号比一次降价更重要:大模型的竞争重点,正在从“谁的参数更多”,转向谁能用更少的活跃参数和缓存,完成更复杂、更长时间的任务。

模型不一定要“每一步都全力运转”。把算力用在最需要的地方,可能比一味做大模型更重要。

需要注意:目前“超过V4-Pro”等性能结论主要来自DeepSeek官方测试。技术报告也承认,新模型在部分需要专业科学知识的复杂Agent任务上,与超大型闭源模型仍有差距。真实效果还会因任务、提示词、推理预算和调用方式不同而变化。

V4.1-Flash真正值得关注的,不只是一次跑分领先,而是它展示了一条更现实的路线:让模型保持足够强的能力,同时压低长任务的计算和存储成本。未来真正进入办公、科研和生产流程的AI,拼的可能不只是“有多聪明”,还包括“能否稳定、快速、经济地一直干下去”。

AI巨头集体踩刹车?

从Anthropic的“配速”倡议,看AI行业的速度与安全之争

当AI开始调用工具、持续执行任务,甚至多个智能体协同行动,风险也从“答错一道题”升级为“做错一连串事”。站在最前沿的AI公司负责人,为什么主动提出减速?

这一次,AI行业开始谈论“配速”。

9月12日,Anthropic首席执行官达里奥·阿莫代伊发表长文《We Must Pace the Frontier》,提出应该放慢前沿AI能力提升的节奏,让安全研究、测试和监管有时间跟上。随后,OpenAI首席执行官萨姆·奥尔特曼等行业人士也表达了支持。

这并不意味着AI公司准备停止训练模型。真正的关键词不是“停”,而是“配速”:能力每向前走一步,安全措施、独立验证和社会治理也要跟上一步。

为什么偏偏是现在

过去,人们担心AI,更多是因为它可能胡编答案、生成虚假内容或者泄露隐私。如今,风险正在发生变化。

新一代AI已经不只是坐在聊天框里回答问题。它可以调用软件、访问网络、编写和运行代码、处理文件,还可以把复杂任务拆分给多个智能体协同完成。

这意味着,一次错误不再只是一句话说错了。一个拥有工具、权限和长时间运行能力的智能体,可能连续执行许多错误操作;多个智能体协同时,行动速度和影响范围还会进一步扩大。

智能体风险正在从单点工具扩展到协同行动|AI生成示意图

阿莫代伊把今年发生的AI智能体安全事件视为警报。他担心,如果未来模型能力继续快速增强,而约束机制没有同步升级,相似的智能体集群可能把局部安全问题放大为大规模网络风险。

他警告称,如果约束机制没有同步升级,未来6至12个月内,类似上述事件中的智能体集群可能具备通过持续性僵尸网络大规模控制互联网的能力。

需要特别说明:这是他在特定条件下作出的风险推演,不是对必然结果的预测,也不是科学界已经形成的统一结论。

《2026年国际AI安全报告》给出的判断更为谨慎:当前AI系统已经表现出一些与失控风险相关的早期能力,但还没有达到能够造成失控的水平;专家对这类风险发生的概率、时间和严重程度仍存在很大分歧。

所谓减速 到底要怎么减

阿莫代伊提出了三个层次的方案。

第一步 让独立评估者真正进入企业内部

目前,公众看到的AI安全信息,大多由开发模型的公司自己选择和公布。外部机构通常只能测试已经发布的产品,很难看到训练过程、内部事故和完整记录。

Anthropic承诺引入常驻的第三方评估团队,让其获得接近内部安全人员的工具和权限,检查企业是否履行安全承诺、评估训练流程,并在必要时公开重要发现。

这类似于给前沿AI实验室增加长期驻场的“安全监督员”。评价一套AI是否安全,不再只听开发者怎么说,而要让独立机构看到证据。

第三方评估让AI安全主张可以接受外部验证|AI生成示意图

第二步 让同行采用共同的安全标准

如果只有一家公司主动减速,而竞争对手继续全力冲刺,谨慎的一方可能在商业竞争中处于不利位置。因此,第二步需要多家前沿AI公司建立共同标准。

一种设想是设置“安全检查点”:当模型达到某种危险能力,例如能够突破常见隔离环境时,就必须先通过更严格的评估、可解释性分析和训练环境审计,才能继续扩大能力或部署范围。

它不是简单规定“每年只能发布几个模型”,而是把能力与安全条件绑定:能力越强,需要提供的安全证据越充分。

第三步 推动全球协调

AI竞争并不只发生在公司之间,也发生在国家之间。如果部分国家减速,而其他国家不受约束,协议就很难持续。

因此,第三步是寻求国际协调,从禁止AI参与生物武器等明确危险用途,到建立共同测试标准,再到讨论对AI自我加速研发设置“速度限制”。

这一步也是最困难的,因为它涉及技术验证、国家安全与国际互信。

都知道有风险 为什么还是难踩刹车

谁先减速,谁就担心被别人超过。

前沿模型需要巨额算力、人才和资金投入。企业必须向投资者证明自己仍在领先;国家也担心在关键技术竞争中落后。即使每个参与者都认为整体速度过快,单独减速仍可能付出巨大代价。

这就是典型的“竞赛困境”:每个人都想更安全,但没有人愿意成为唯一慢下来的那个。

速度、安全与竞争构成前沿AI的现实困境|AI生成示意图

不过,外界对这一倡议的动机也存在质疑。有分析人士指出,推动“安全标准”成为行业共识,客观上可能有利于已经在安全与合规方面投入较多的头部公司,同时对资源有限的追赶者形成隐性门槛。

这种动机推测目前没有得到证实,但提醒人们:评价企业的安全主张,不仅要听公开表态,也要观察它是否接受独立审查、是否兑现具体承诺。

因此,真正有效的减速不能只靠企业负责人的自觉。它至少需要三样东西:可以检查的共同标准、相对独立的外部评估,以及覆盖主要参与者的协调机制。

我们应该感到恐慌吗

不必把这次讨论理解为“AI马上要失控”。现有证据并不支持这样的确定性结论。

但也不能因为灾难尚未发生,就认为风险只是科幻故事。AI智能体获得的工具、网络访问和操作权限越多,一次失误可能造成的现实影响就越大。即使不出现极端的“失控”,错误交易、数据泄露、自动化网络攻击和关键系统误操作,也已经足够值得重视。

对普通用户而言,更现实的安全原则是:

  • 不要把支付、删除数据、公开发布等高风险权限一次性交给AI;
  • 重要操作保留人工确认,不把“能自动完成”误认为“可以无人监督”;
  • 使用企业AI工具时,弄清数据会被发送到哪里、保存多久;
  • 对AI作出的医疗、法律、金融和安全判断进行专业复核。

结语

这场争论真正值得关注的,不是哪位企业负责人说出了最吓人的预测,而是AI行业开始承认一个现实:模型能力、安全技术和治理速度之间,已经出现了越来越明显的时间差。

汽车变快以后,人类发明了刹车、安全带、交通规则和碰撞测试。AI也需要类似的基础设施。

“放慢一点”并不是放弃创新,而是为验证、纠错和建立规则争取时间。未来真正可靠的AI竞争,或许不只是看谁跑得最快,还要看谁能证明自己在高速前进时依然可控。

玩转AI-千问办公上线一个月用户破3000万

一个月,3000万用户。

9月4日,阿里巴巴披露,千问办公在中国市场公测上线一个月,总用户数已突破3000万,其中超过一半为企业用户。这组由企业公布的数据很抢眼,但更值得关注的是:为什么一款办公AI,会在短时间里吸引这么多人试用?

答案可能藏在一个人人熟悉的麻烦里。过去,我们让AI写一段文字、整理一份摘要、分析一张表,最后仍要自己复制到Word,重新搭PPT,再把数据、图片和格式逐个搬过去。AI负责生成一段,人负责把这一段变成能交付的东西。

千问办公瞄准的正是这段“最后一公里”:让AI少停留在回答框里,开始向文档、表格、PPT、网页和多媒体等可交付成果推进。

一个月3000万 背后不只是多一个聊天框

千问办公由阿里巴巴在8月3日开放公测。官方介绍显示,它整合了Qoderwork、Mulerun和悟空的核心能力,把桌面智能体、云端智能体和企业协作智能体放进同一平台。

这句产品介绍听上去有点技术化,换成日常语言,就是它希望接住一整段办公流程:先读取材料,拆解任务,再调用文档、表格、PPT、网页、图片或视频等能力,最后把结果以文件或页面的形式交出来。

阿里巴巴还称,千问办公首月完成了120个版本更新,推出超过1000项新功能。数量不等于质量,但密集迭代至少说明,办公智能体的竞争已经从“模型会不会答”转向“产品能不能做完”。

它想砍掉的是办公室里的复制粘贴

假设你要做一份项目汇报。传统用法是先让AI提炼材料,再把答案粘进Word;接着请它列PPT大纲,自己去演示软件里重搭;数据还要回到表格里计算,最后再手动统一标题、图表和页面风格。

在千问办公的设想里,这些步骤可以放进同一个任务里:把参考资料交给它,说明汇报对象、页数、重点和输出格式,让它整理材料、生成文档或PPT,再根据反馈继续修改。官方界面还会在任务执行过程中追问输出格式、重点方向等信息,而不是只吐出一段通用答案。

这并不意味着文件拿来就能直接发布。数字、引用、版式和业务判断仍要人工复核。真正节省的是搬运、转换和重复排版的时间。人不一定少做判断,但会少做很多搬运。

网页 桌面 钉钉 三个入口接不同的工作状态

目前,千问办公已提供网页端、桌面端和钉钉内嵌入口。网页端适合临时使用,打开浏览器即可开始;桌面端可以在用户授权后读取本地文档、表格、图片和视频,并将处理结果保存回指定文件夹;钉钉入口更接近团队协作,可结合群聊、日程、文档和企业业务系统处理任务。

三种入口的差别,不只是换了一个登录位置。网页端强调随时可用,桌面端强调本地文件和浏览器操作,钉钉端强调组织数据与协作流程。对于经常在多个软件之间来回切换的人,这种“一个入口接住多种工作”的思路,正是它最有吸引力的地方。

当然,能力并非在每个入口完全一致。阿里云帮助文档注明,浏览器自动化目前仅桌面客户端支持,部分网页制作能力也有端侧差异。使用前仍要看清当前版本和权限,不要把产品总览里的每项能力都理解成所有用户、所有入口立即可用。

放到国内外横向看 千问办公站在什么位置

办公AI已经形成几条不同路线。WPS AI和Microsoft 365 Copilot更贴近传统办公软件,在熟悉的文字、表格、演示和邮件中加入AI;飞书与Gemini for Workspace依托协作平台和云端文档,让AI直接使用团队已有的信息;ChatGPT Work则从通用智能体出发,跨应用、文件和网页完成任务。

千问办公的特点,是把上述几种路线尽量放到同一个入口:既做文档和PPT,也连接本地文件、浏览器和钉钉,还允许把重复任务沉淀为技能或定时任务。它的优势是覆盖面广,挑战也同样明显——链条越长,越考验结果稳定性、权限控制和最终校验。

代表产品主要起点更突出的能力更适合谁
千问办公统一任务入口文档、表格、PPT、网页、本地文件、浏览器与钉钉协同希望减少跨工具搬运的个人和团队
WPS AIWPS文字、表格、演示、PDF在现有Office文件里生成、改写、分析和排版长期使用WPS处理文件的人
飞书AI能力云文档、多维表格、消息与工作流团队协作、数据表、自动化和业务流程资料本来就在飞书中的组织
Microsoft 365 CopilotWord、Excel、PowerPoint、Outlook、Teams结合Microsoft 365应用和组织数据工作已经使用Microsoft 365的企业
Gemini for WorkspaceGmail、Drive、Docs、Sheets、Slides围绕Google Workspace文件和邮件协作以Google云端办公为主的用户
ChatGPT Work应用、文件、网页与桌面任务跨来源整理信息并创建或修改多类交付物工具混用、任务类型变化较多的用户

真正的分水岭 是能不能把成果交出来

办公AI的第一阶段,竞争的是谁回答得更聪明;第二阶段,竞争的是谁能把回答变成可编辑、可继续修改、可进入真实流程的成果。千问办公的出现,把这条趋势摆得很直白。

但“能交付”不等于“可免审”。AI生成的报告可能遗漏来源,表格公式可能不适合实际数据,PPT也可能在逻辑、字号或图片版权上出问题。越接近最终文件,用户越要明确目标、提供可靠材料,并设置检查节点。

更稳妥的使用方式,是把任务说具体:交给谁看、需要什么格式、必须保留哪些数据、哪些内容不能改、最后如何验收。把这些条件写清楚后,智能体才更像一位能持续返工的助理,而不是一次性内容生成器。

普通人现在值不值得试

如果你的工作经常在文档、表格、PPT和网页之间来回切换,千问办公值得试一轮。可以先从低风险任务开始:整理公开资料、把会议笔记变成结构化文档、根据已核实的数据制作一页汇报,或者把重复的信息收集流程做成定时任务。

涉及合同、财务、客户数据和对外发布内容时,应先确认组织权限与数据要求,并保留人工复核。办公智能体真正适合接手的,是规则清楚、材料明确、结果可以检查的任务。

千问办公首月的用户增长,说明很多人已经在寻找一个新答案:当AI不再只给建议,而是开始碰文件、碰系统、碰交付物,我们该怎样重新分配自己的时间?

也许以后判断一款办公AI是否好用,问题不再是“它说得像不像人”,而是“它做出来的东西,我还要返工多少”。

玩转AI——当ChatGPT开始卖广告,AI回答还会不会“纯粹”?

你有没有过这种体验:

打开搜索引擎,输入”哪款手机拍照最好”,结果前三条全是广告。你往下翻,才找到真正的内容。

那如果换成ChatGPT呢?

你问它同样的问题,它给你一段条理清晰、语气中立的回答,告诉你A款拍照最好、B款性价比高、C款适合视频。你正要接受这个建议,眼角余光扫到下方一行小字——”赞助内容”。

这时候,你还信不信它的判断?

一、先从那个10亿美元的数字说起

今年8月31日,OpenAI宣布,ChatGPT Ads的年化收入运行率(annualized run rate)达到了10亿美元。简单换算一下,就是它现在通过广告,每天能赚大约270万美元。

这个数字第一次看到时挺吓人的——一家年轻的AI公司,广告流水已经赶上了不少老牌媒体。

但仔细看,这10亿美元不是凭空来的。从今年2月在美国小范围测试,到随后逐步向更多国家和免费用户铺开,再到8月底跑通商业模型,OpenAI用了大约半年时间,把广告从”实验”变成了”生意”。

用户端能看到的变化是:当你使用ChatGPT免费版或每月8美元的Go套餐时,部分回答下方会出现一个标注为”赞助内容”的卡片。它不遮答案、不弹窗、不打断对话,只是安安静静地待在那里。

但问题也恰恰出在”安安静静”这四个字上。

二、AI广告,和搜索广告到底有什么不同?

你可能会想:搜索引擎不也卖广告吗?Google首页那么多广告位,怎么没人担心”答案不纯粹”?

区别在于,搜索广告和自然结果是并列的。用户看到广告,也看到它旁边的自然链接,可以选择点哪个。而且在搜索结果的排序里,通常有付费、权威、时效性、相关性的多重信号,用户能直观判断哪些是广告、哪些是原生结果。

而AI对话不一样。ChatGPT给的是一个整合好的结论——没有多个链接让你挑,没有排序让你判断。它直接告诉你”答案是什么”,语气流畅、格式整齐,几乎不带任何不确定性。

当这个结论下方紧跟着一条赞助推荐时,绝大多数人不会有意识地去质疑:”这段答案是不是还纯粹?”因为AI的答案本身是独立生成的,但赞助内容就放在答案正下方,阅读习惯会让读者自然顺着答案往下看。

这种影响极其隐蔽。

三、真正值钱的,不是”关键词”,是”意图”

Google卖广告,卖的是”关键词”——你搜”洗衣机”,它卖洗衣机广告。

短视频卖广告,卖的是”兴趣”——你爱看猫,它推猫粮。

但ChatGPT卖广告,卖的是“意图”。

什么叫意图?就是你问”我要给孩子选暑假课程””帮我挑一台办公电脑””哪家医院的眼科最好”的时候,你的消费决策已经走到最后一步了。你不是在随便逛逛,你是在做决定。

这时候,一个看起来中立、权威的AI回答,加上紧贴着答案的赞助推荐,会产生非常强大的影响。它不是打断你,而是在你最需要信任一个推荐的时候,正下方就有一份。

这种”决策前一秒”的商业入口,比搜索关键词或算法推荐都更接近成交。

这就是为什么广告主愿意为这个位置付钱。

四、OpenAI做了哪些区分,够不够?

OpenAI当然也知道这种顾虑。它在官方说明里列出了几道防线:

1. 广告有清晰标注。每个广告都标了”赞助内容”或”sponsor”,视觉上与回答区隔开。

2. 广告不影响回答。广告系统与聊天模型独立运行,广告主无法干涉ChatGPT的答案,也无法访问用户的对话记录。

3. 敏感话题不展示广告。涉及健康、医疗、心理健康、政治等敏感话题时,广告会自动屏蔽。

4. 用户有控制权。可以在设置里关闭广告个性化(不让广告参考你的聊天记录和记忆),也可以删除广告数据。

5. 免费用户可选择免广告。在设置里关闭广告后,免费版用户将不再看到赞助内容,代价是每日消息限额会被调低。

6. 未成年人账户、临时聊天(Temporary Chats)模式不显示广告。

这些措施听起来很完善。但回到实际使用场景,问题仍然存在:当用户看到一个流畅、清晰、值得信赖的AI回答时,会不会下意识地认为它下方的赞助内容也同样值得信赖?

这个问题的答案,不在OpenAI的官方说明里,而在每个用户的实际使用习惯里。

五、普通人该怎么办?

我不认为ChatGPT Ads是AI的末日,也不是OpenAI的背叛。免费的互联网服务,最终总要有人买单。过去是搜索广告,现在是AI广告——这本身没什么好惊讶的。

但有几件小事,你可以留意一下:

1. 看到”赞助内容”四个字,要知道那是付费推荐,与AI回答本身无关。OpenAI的答案确实不受广告影响,但付费推荐不会影响回答、却会影响用户——这种影响可以非常隐蔽。

2. 涉及健康、医疗、金融、教育这类选择,多查一手来源。不要把AI的流畅表达等同于客观结论,它只是一个参考。顺藤摸瓜去查原始资料,或者至少对比几个不同的来源,仍然是非常必要的验证步骤。

3. 不想看广告,有办法。升级到Plus或Pro(全程无广告);或者在免费版设置里关闭广告(代价是每日消息限额被调低);又或者使用临时聊天模式(不显示广告)。

最后想说一句:以后你再问ChatGPT一个问题,看到它给出的答案时,不妨多问自己一句——如果这个答案下面出现了付费推荐,我还能分得清,什么是独立的判断、什么是商业的引导吗?

这个问题的答案,可能比10亿美元的年收入,更值得我们关心。

玩转AI——Codex实战:一套小学 AI 课件,我是怎么和 Codex 来回改了 7 轮的

很多人以为,让 AI 做 PPT,就是输入一句“帮我生成课件”,然后等它吐出一份成品。

但这次做“小学人工智能通识课”时,我发现真正有价值的不是第一次生成,而是后面一轮轮把它改到能用。

这次实验对象是一套小学 AI 通识课课件:把教学方案和实验操作手册,变成 15 页、16:9、可编辑、能直接进教室使用的 PPT。

我不是让 Codex 随便做一套“看起来像课件”的 PPT,而是不断给它加条件、挑问题、控制用量、缩小修改范围,再让它回去重做。最后成品能落地,靠的不是一句神奇提示词,而是一段很具体的人机协作过程。

第一轮:先问清楚,应该怎么向 AI 提需求

一开始,我手里有两个文件:教学方案和实验操作手册。

如果直接把文件丢给 AI,说“帮我做 PPT”,结果很容易发散:它可能把教师话术放进学生课件,也可能把实验步骤堆成说明书。

所以第一步,我没有急着让 Codex 生成成品,而是先问它:如果要依据这两个文件制作教学 PPT,应该给出怎样的提示词。

这个动作看似绕了一步,其实很关键。

AI 很擅长执行,但前提是任务边界清楚。与其一上来就让它做成品,不如先让它把“应该怎样下任务”讲清楚:用哪些文件、生成多少页、哪些截图能用、哪些内容不能进学生课件。

这一步相当于先把工作说明书写出来,再让 AI 开始干活。

第二轮:控制页数和用量,不让它一上来就“豪华装修”

后来我逐渐把要求收紧:15 页就可以,不要做太大,避免浪费用量;要配图,但不能为了配图而配图。

我还特别强调:不要把每一页都做成整张 AI 背景图。整页图看起来热闹,但修改成本高,用量也大,一旦文字错了、版式不合适,就很难继续精修。

最后,约束变成了一套更明确的规则:15 页、16:9、可编辑 PPTX;浅色背景;每页只讲一个核心点;不生成演讲者备注;不把年级、课时、教学目标、教师话术、设计意图放进学生课件;实验页优先使用真实截图,概念页再使用辅助小图。

这些要求看起来像细节,其实是在给 Codex 画边界。

如果没有这些边界,它很可能会做出一份“内容很多、看起来也完整”的课件,但小学生看不懂,老师上课也不好用。把标准提前说清楚,后面的生成、修改和质检才有依据。

第三轮:配图策略改成“局部小图”,而不是整页 AI 大图

做儿童课件时,很容易掉进一个坑:页面很可爱,但图和知识点没关系。一开始,整页 AI 图看起来很漂亮,可问题也明显:用量大、修改难、容易盖住文字。

于是我改了要求:能不能不要局部生小图?比如需要一台电脑,就只生成一台电脑;需要麦克风、耳朵、声波,就只生成这些透明背景小插画,再嵌入 PPT。

这个方法明显更适合课件生产。

它不是让 AI 每页画一张“大海报”,而是先设计好页面版式,再按需要补小图。这样既节省生成次数,也方便后面调整:文字可以改,图片可以挪,实验截图也能保持真实。

后来这套思路变成了一个稳定分工:概念页用局部小图解释抽象概念,实验页用真实截图保证可复现,总结页用少量图标帮助学生记住步骤。

第四轮:第一版出来后,我开始挑毛病

第一版出来后,并不等于完成。

我继续看预览挑问题。很多问题不是“大错”,但会直接影响课堂使用。

比如,有的页面右下角有编号,我要求删掉;有的页面是空记录表,看起来像让学生填,但其实没有教学意义,我要求改成能直接判断的“证据卡”或“情境判断页”;有的课件第 8 页、第 14 页内容太空,我要求重做;还有一次我只想改“手势”那一套,不想影响另一套,Codex 就必须停下来缩小修改范围。

下面这张表记录了其中几轮具体的修改和响应:

我提出的问题Codex 后续处理
右下角编号删掉删除整套 PPT 右下角页码
第 9 页不要空记录表改成有实例推理链的页面
手势第 8 页也要改改成“位置变化的对照路径”
手势第 14 页不要空表改成“改进前后看什么证据”
只要手势的缩小修改范围,不动另一套
第 14 页文字少一些保留判断逻辑,压缩重复解释

这几轮对话很重要。

因为很多 AI 工具最容易出问题的地方,不是第一次不会生成,而是用户提出具体修改后,它会不会改错对象、会不会把已经确认的部分又弄乱。

第五轮:发现后半段没设计感,继续返修

做课件还有一个很常见的问题:前几页因为是开场,往往设计得比较好;越到后面,页面越容易变成普通文字堆叠。

我看到后半段设计感明显下降,就继续指出:前几页还有点设计,后面完全没有设计感了。

Codex 后续不是简单换个背景,而是重做后半段结构:把实验操作页改成交替场景,把结果页强化视觉层级,把总结页改成更清楚的关卡或任务台。

这一步让我感觉,它更像一个可以持续返工的制作助理。

我说“这里不好”,它需要理解“不好”具体指什么;我说“后半段没有设计感”,它需要判断是配色问题、结构问题、留白问题,还是页面节奏问题。

这比单纯生成一份 PPT 更接近真实工作。

第六轮:把抽象问题,改成孩子能进入的故事

这套课件里有一节叫《AI 做的事情都是对的吗?》。

如果直接讲“AI 可能存在语义理解偏差”,小学生大概率听不进去。Codex 最后选择了更生活化的切口:翻译耳机闹笑话。

比如,“我们班卧虎藏龙”不能按字面翻成教室里真的有老虎和龙;“piece of cake”在语境里不是一块蛋糕,而是“这件事很容易”;“放鸽子”也不是把鸽子放走,而是没有按约定出现。

这样一来,学生先被问题吸引,再自然进入结论:AI 翻译看起来每个词都翻出来了,但整句话仍然可能错。

这个设计比“直接讲概念”更适合孩子。它不是先告诉学生一个抽象结论,而是先让学生发现:咦,明明每个词都翻了,为什么听起来这么怪?当孩子自己先发现问题,再讲“语境”和“核查”,就不再像灌输知识,而像是在解决一个真实小谜题。

第七轮:不是堆页面,而是设计一条课堂路径

最后的课件不是把材料平均分成 15 页,而是按课堂节奏重新组织。

这时距离最初那两份教学材料,已经不是简单“换个格式”的变化,而是变成了一套有开场、有任务、有实验、有收束的课堂作品。

先用几个“翻译闹笑话”的场景制造好奇心;再用一页最小理论说明“原话和语境进入 AI,译文会影响对方理解”;接着给出四步核查方法:读完整句子、联系语境、圈出可疑表达、说出实际意思;最后进入真实实验,让学生观察“核查前后剧情有没有变化”。

也就是说,Codex 做的不是“把文字放进 PPT”,而是把材料整理成一条学生能走下去的学习路线。

最后不是交文件,而是做质检

最容易被忽略的,其实是最后一步。

Codex 在生成 PPT 后,还要逐页检查:标题有没有异常换行,文字有没有溢出,图片有没有被裁切,实验截图是否清楚,页面左右留白是否均衡,是否出现了不该给学生看的教师端内容。

例如在另一节《AI 怎么认出一张脸》的课件中,质检还专门检查了几个边界:24/24 和 6/6 只能写成学习进度,不能误写成准确率;0.94 不能写成身份置信度;人脸数据要提醒只在课堂内使用、不上传、不传播。

这一步其实最像一位谨慎的助教:它不只负责“做出来”,还要负责“别出错”。所以这次交付前,真正省时间的不是第一版生成,而是后面的反复检查、定位问题和局部返修。

这次实验真正有价值的地方

这次让我感觉比较明显的是,Codex 更适合承担“长链条制作”里的中间层工作。

如果人的角色是定方向、审关键、做最终判断,把重复整理、初稿搭建和细节检查交给 Codex——这种分工,比“让它一口气做完”更接近真实可用。

下次再做类似课程时,我不会只问 AI:“帮我做个 PPT。”

我会更具体地问它:“请先判断学生能看什么,再把这节课设计成一条孩子能走完的学习路线。”

这个问题,才真正接近一套好课件的起点。

玩转AI——Codex 实战:一篇公众号稿背后的 AI 协作流程

很多人第一次用AI 写文章,都会有一种很熟悉的快乐:输入一句需求,几秒钟后,一篇稿子就出来了。

但真正做过公众号的人都知道,麻烦往往不在“第一版文字”。麻烦在后面:选题要不要换,事实要不要核,图片对不对,排版能不能复制,领导临时改方向怎么办,最后文件夹里是不是只剩能交的版本。

这次“玩转AI”没有继续写某个新工具发布,而是把一段真实的稿件制作对话拿出来,当成一个案例:看看 Codex 这类智能体,能不能把一篇内容从“差不多写完”继续推到“真的能发”。

Codex 是 OpenAI 面向复杂任务、代码和文件协作场景的智能体。在授权的工作区里,它可以读取项目材料、生成或修改文件,并按规则持续推进任务。放到内容生产里,它不像一个只会写几段话的助手,更像一个会跟着你一起返工的执行搭子。

一、真正的开始,不是“帮我写一篇”

如果只让AI 写正文,这件事其实没什么新鲜。真正有意思的是,这次任务一开始就不是“写一篇稿”,而是“按一套固定流程交付”。

对话里先定下了很多边界:选题阶段只给候选,不写全文;用户只回复序号后,才进入正式写稿;公开稿里只保留读者需要看到的内容;图片不能是泛泛的科技氛围图;公众号版字号也要统一。

这一步看起来啰嗦,但它解决的是内容工作里最常见的问题:人以为自己说清楚了,AI 以为自己听懂了,最后交出来的东西却总差一点。

二、需求会变,AI 也得能跟着变

真实工作很少一条指令走到底。中途,稿件方向变了:原来准备写“入口介绍”,后来改成 Codex 使用类文章;原来想用第一视角,后来又发现读者可能更接受案例拆解。

这就是内容生产最真实的样子:不是需求一开始就完美,而是写着写着,方向、口吻、配图、格式都在变。

如果AI 只能写第一版,它会在这里失效。Codex 的价值,是能把新要求并回原来的交付规则里:主题换掉,文章重写,配图重配,Word 和公众号版也一起改。

三、另一轮审稿,不是走形式

这次还有一个关键环节:不是Codex 自己写完自己夸自己,而是把稿件发到 DeepSeek 的“每周新闻”对话里,让另一个模型挑问题。

DeepSeek 第一轮意见很直接:稿子太像内部复盘,读者不一定关心“我怎么工作”;开头缺少 Codex 基础介绍;“跑完整流程”的说法容易让人误以为全自动;标题也不够像公众号新闻。

这些意见没有被机械照收。Codex 随后逐条回应:该补的补,该弱化的弱化,但也保留真实案例里的过程感。最后稿子才从“内部复盘”往“读者能用的案例”靠近。

四、最像真实工作的,是反复改图

写稿过程中,返工最多的其实不是标题,而是图片。

先是配图太泛,后来又被指出“不是内容相关”;有的图文字太空,有的图像单独人物图,有的界面是英文,有的地方还要检查文字溢出。最后,截图要求又变成:直接用真实对话视角。

这很真实。公众号文章不是把正文贴上去就结束,图片承担的是“让读者相信你真的跑过流程”的作用。尤其是讲 AI 使用案例时,越是抽象的能力,越需要具体的过程截图来落地。

五、最后剩下的,是那些最容易忘的小事

把一篇稿子做到最后,最怕的不是没有正文,而是各种小问题堆在一起:Word 改了,公众号版没改;图片换了,网站小图没压;公开稿里混进了不该给读者看的说明;文件名看着差不多,真正交付时又找不到最终版。

Codex 适合接手的,恰好是这些“单件不难、合起来很烦”的工作。

它能把交付物当成一组文件来看:Word 定稿、公众号排版 HTML、配图原图、网站压缩图、事实核查记录。更重要的是,它会按检查清单回头看一遍:图片数量对不对、网页字号对不对、公开稿有没有多余内容、文件能不能打开。

六、普通人可以怎么用?

如果你也想把一项重复工作交给AI,不要一上来就说“帮我做完”。可以先这样开口:

我想把【某项重复工作】做成一条可复用流程。请你先不要直接产出最终结果,先帮我拆成:输入材料、确认节点、可自动执行的步骤、需要人工判断的步骤、最终交付物、交付前检查清单。等我确认流程后,再开始执行。

这句话的关键,是先让AI 学会“什么时候不能乱动手”。

等规则稳定下来,AI 才不只是一个写作按钮,而会变成一个能陪你把事情做完的搭子。它不替你拍板,但能帮你少漏很多细节。对每天都要交稿、交表、交方案的人来说,这可能比“写得更快”更实际。

玩转AI-MiniMax H3开放权重:图片、视频和声音,现在可以一起交给AI

过去做一条AI视频,常常要把图片交给一个工具、声音交给另一个工具,再用剪辑软件把它们拼起来。MiniMax H3想解决的,正是这种“素材各管一段”的麻烦:文字、图片、视频和音频可以作为同一组参考材料,一起参与视频生成。

对普通用户来说,这次更新值得关注的不是又多了一个模型名字,而是做视频的入口正在变得更像一次完整的内容创作。

一、H3已经能用,而且不只停留在发布会里

MiniMax在7月31日发布H3,把它定位为通用多模态视频模型。现在,用户可以从海螺AI的H3官方页面直接进入体验;开发者也可以通过MiniMax开放平台调用模型。与此同时,ComfyUI已经原生支持H3开放权重工作流,可以在本地部署文本生视频、图片生视频和参考素材生视频等流程。

这里要分清两件事:在线平台和API更适合普通用户,操作门槛低;开放权重更适合有显卡、懂模型部署的人。开放权重不等于“任何电脑都能轻松跑”,更不等于生成完全免费。

二、它把四类素材放进了同一个“上下文”

过去给视频模型下指令,最常见的是一段文字,或者一张首帧图片。H3进一步支持把文字、图片、视频和音频放在一起,让模型同时参考人物外观、动作节奏、镜头语言和声音氛围。

比如,你可以提供一张产品图、一段运镜参考和一段背景音乐,再用文字说明“镜头从近景慢慢拉远”。模型面对的不再是一句孤零零的提示词,而是一套更完整的创作条件。

官方资料显示,H3可生成带原生立体声的视频;在线平台和API支持4至15秒、768P或2K输出。这里的“2K”指在线平台或API能力,不应直接套到本地开放权重工作流。ComfyUI官方教程注明,本地原生画布以短边768像素为基准,并有画布上限。

三、普通人最容易上手的,是这三种做法

1. 只写文字:先把想法变成短片

适合没有现成素材、只想快速试创意的人。写清主体、场景、动作、镜头和声音,比堆砌“电影感”“高级感”更有效。

2. 给首尾画面:让变化过程更可控

如果你已经有一张开场图和一张结束图,可以让模型补出中间过程。产品展示、海报动效和简单转场,都可以从这种方式开始。

3. 同时给参考图、视频和音频:让结果更接近你的目标

这是H3最有代表性的用法。参考图负责人物或产品外观,参考视频负责动作和运镜,参考音频负责节奏和声音风格。素材越多不一定越好,关键是每份材料分工明确,彼此不要冲突。

四、“开放权重”让它多了一条本地路线

对于普通读者,开放权重最实用的理解是:除了在网页上点按钮,还可以把模型下载到自己的设备或服务器里,通过ComfyUI等工具搭建工作流。这样更便于批量处理、接入内部流程,也能减少素材在多个在线工具之间来回传递。

但本地运行要付出显卡、存储、部署和维护成本。你还需要自己处理模型文件、工作流节点和参数设置。对只偶尔做几条短视频的人,先用在线入口通常更省事;对需要稳定批量生产、希望掌控工作流的人,本地部署才更有意义。

五、别只看榜单,先看它能不能完成你的任务

官方页面展示了H3在多项视频生成与编辑评测中的表现,但榜单会随样本和新模型更新。对普通用户而言,更有用的判断标准是三个:人物和产品是否保持一致,动作和镜头是否听指令,声音与画面是否真的同步。

第一次尝试时,可以从5秒左右的小任务开始:只放一到两份关键参考,先测试主体和动作,再逐步加入声音、运镜和更多素材。这样更容易判断是哪一项条件影响了结果,也能少花不必要的生成额度。

还要注意,上传他人照片、声音或品牌素材前,应先确认肖像、声音和版权授权。模型能合成,不代表内容就自动具备发布许可。

H3真正有意思的地方,不只是“又能生成更清晰的视频”,而是把图片、视频、声音和文字放进了一次创作里。过去需要在多个工具之间接力的流程,正在被压缩成一个更统一的入口。

如果你只是想让一张照片动起来,在线页面已经足够;如果你要把参考素材、声音和批量流程结合起来,再考虑API或本地开放权重。先从最小任务开始,往往比一次把所有功能都塞进去更容易得到可用结果。

玩转AI——AI也开始开项目组了:腾讯云多 Agent 协同,让“一个助手”变成“一个项目组”

过去用 AI,常常是你把一件事交给一个助手,从头问到尾。现在,腾讯云把“组队干活”搬进了智能体:一个主 Agent 当队长,多个子 Agent 分头研究、互相沟通,再把结果汇总回来。

先把对象说清楚:腾讯云近期介绍的这项能力,不是普通员工直接使用的“智能工作台”,而是腾讯云智能体开发平台 Claw 模式面向需要配置 AI 应用的技术人员或开发者提供的多 Agent 协作能力。

Claw 可以理解为平台里一种能自主规划、调用工具并完成多步骤任务的应用模式。听起来有点技术,换个说法就是:以前你请了一位全能助理;现在,这位助理可以临时拉一个项目群。

一、AI“小组作业”到底怎么分工?

这种“组队”也分两种。

最基础的是“单向委派”。它像项目经理分配:你设置一个主 Agent,再给它配几个角色不同的子 Agent。主 Agent 先理解任务,把工作拆开;子 Agent 各自完成后,把结果交回主 Agent,由它统一整理。组员之间不用互相讨论。

比如你要做一份竞品报告,可以让 3 个子 Agent 分别研究价格、功能和用户评价。它们不用互相聊天,最后把材料交给主 Agent 就行。这种方式适合需要分头推进、但成员之间不必反复沟通的任务。

如果任务更复杂,需要成员互相追问、质疑和接力,就可以在配置应用时进入高级设置,手动打开“允许多 Agent 团队协作”开关。这是应用配置,不是聊天过程中临时打开。

开启后,子 Agent 不只会向主 Agent 汇报,还能直接与其他子 Agent 沟通。官方目前允许一个团队最多包含 1 个主 Agent 和 19 个子 Agent。

但先别急着把 19 个位置都坐满。开了团队协作,也不代表每个任务都会自动组队;系统会根据任务需要决定是否启用。AI 团队和真人团队一样,人多不一定效率高,角色不清反而更容易乱。

二、三个普通人能用上的场景

场景一:做一篇需要核实的内容

假设你要写一篇公众号新闻,可以这样分工:

• 资料 Agent:收集最近 7 天的候选信息,并附上官方来源;

• 核实 Agent:检查日期、产品状态和收费规则;

• 审稿 Agent:专门找夸大、歧义和过时信息;

• 主 Agent:负责写作、取舍和最终确认。

这里有一个关键点:不要让好几个 Agent 同时改同一篇正文。腾讯云官方也提醒,多 Agent 同时编辑同一内容容易产生冲突。更稳妥的做法,是让它们分别提供材料和意见,最后只由一个 Agent 执笔,再由人确认。

场景二:做一次多角度调研

买设备、选供应商、做课程调研时,可以让不同 Agent 各看一个方向:一个查价格,一个查服务,一个找案例,一个专门验证风险。

单个 AI 很容易顺着第一条思路一直说下去。角色分开后,相当于多了几双眼睛,尤其适合互相挑战结论。

场景三:做一个小型应用

再往技术场景走一步,如果你要做网页或内部工具,可以让前端 Agent、后端 Agent、测试 Agent 分工。测试 Agent 发现问题后,可以直接把问题发给对应成员,不必每次都绕回主 Agent。

这类需要交接、反馈和返工的任务,才真正体现“团队协作”的价值。

三、什么时候别开团队协作?

第一,问题很简单时不要开。

查一个概念、改一段话、整理一张表,一个 Agent 就能完成。为了显得高级而组队,往往只会多绕几圈。

第二,流程完全按顺序进行时,不一定要开。

如果第二步必须等第一步结束、第三步又只能等第二步,普通工作流可能更清楚。

第三,要留意成本。

腾讯云官方提示,开启团队协作后,Token 消耗大约是单向委派的 2—3 倍。Token 可以简单理解为 AI 处理信息的计量单位,参与的角色越多、沟通越频繁,通常就会消耗更多。

从 7 月 1 日起,智能工作台和 Claw 模式应用运行任务均已结束限时免费公测,转为按运行时长计费;模型、工具和 Skills 还会消耗 PU。PU 是平台的通用计费单位,官方当前换算为 1 PU=0.001 元。实际价格可能调整,正式使用前应以计费页面为准,并先用小任务测试效果和费用。

怎么选,可以记住三句话:

简单问答,用单 Agent。

需要分头查资料,用单向委派。

需要互相追问、接力和返工,再开团队协作。

多 Agent 最值得关注的,不是“同时叫来更多 AI”,而是把过去藏在一个对话框里的工作过程,变成可以分工、交接和检查的流程。

它不会自动让结果变好。真正决定质量的,仍然是角色有没有分清、资料来源靠不靠谱,以及最后有没有一个人负责拍板。

如果让你组一支 AI 小队,你最先会设置哪三个角色?欢迎在评论区告诉我。

玩转AI——Kimi K3来了:这次不只陪你聊天,而是想接住一整套项目

2.8万亿参数、原生视觉、最高100万Token上下文——Kimi K3的数字很醒目,但普通用户真正需要关注的,是它能否读完一整套资料,并把调研、分析、文档和编程等长任务持续做下去。

前几期我们聊过桌面智能体、零代码应用,也聊过能围绕资料做研究的AI工具。本期轮到国产大模型里的“长文本老选手”Kimi。

7月16日,月之暗面发布新一代旗舰模型Kimi K3。官方公布的几个数字很抢眼:2.8万亿参数、原生视觉能力、最高100万Token上下文,并重点面向长程编程、知识工作和复杂Agent任务。

一、Kimi K3升级的重点是什么?

先说结论:K3的重点不是让简单聊天变得更花哨,而是提高处理“重任务”的能力。

过去用AI做复杂项目,经常遇到三个问题:资料一次放不全、对话长了忘记前文、任务步骤一多就开始跑偏。

K3把上下文上限提高到100万Token,适合处理大型代码库、成套项目文档和多份研究资料。这里要注意,100万Token是模型支持的上限;网页端需要相应的高等级会员权益,并不是所有账号默认开放。

它还原生支持图片理解。除了文字、表格和文档,你也可以把截图、图表、流程图一起交给它,让模型结合图文分析,而不是只读其中的文字。以前分析竞品页面,需要先用文字描述页面结构;现在可以直接把网页截图交给K3,让它结合页面布局、图表和文字一起分析。

至于KDA、Attention Residuals和MoE这些技术名词,普通用户不用背。它们最终想解决的都是同一件事:资料更多、任务更长时,模型仍能尽量保持思路连贯。

二、普通人可以用它做什么?

1. 给一整套项目资料做复盘

把几个月的周报、会议纪要、方案和数据表放进去,让它按“目标—进展—问题—下一步”整理,并找出前后矛盾和长期没有解决的事项。

以前我们需要在十几个文件之间来回翻,现在可以先让AI完成第一轮梳理,再由人核对关键结论。

2. 横向比较多份报告

一次上传多份行业报告时,不要只说“帮我总结”。可以直接要求:

比较这些报告的共同判断、主要分歧和数据口径;每条结论标出来源;最后给出三条可执行建议。不确定的信息单独列出,不要自行补全。

这样得到的结果,更接近一份可以继续加工的调研底稿。

以前同时看几份报告,最费时间的往往不是阅读,而是核对同一指标是否采用同一口径;先让AI把差异列出来,人再回到原文确认,可以省掉大量来回翻找的时间。

3. 从资料直接做到成品

K3不仅能输出文字,还可以参与生成文档、表格、PPT和网站等可编辑成果。

例如,你可以让它先读取会议材料,再整理汇报逻辑、制作演示文稿提纲,最后检查遗漏。这种工作方式更接近“把整个任务交给AI”。

以前最容易卡在“内容已经有了,但还要重新整理成不同格式”;现在可以让AI沿着同一套材料继续往下做,减少在文档、表格和PPT之间反复复制粘贴。

4. 处理周期更长的编程任务

对开发者来说,K3更明显的优势是读取大型代码库,并持续完成修改、测试和排错。

普通用户即使不写代码,也可以关注这一点。因为模型能否长期稳定执行编程任务,也会影响它完成多步骤办公任务时的可靠性。

过去处理长任务时,模型常常做到一半就忘了前面的约束,还需要人工反复提醒;K3想提升的,正是这类持续执行能力。

三、怎么开始使用?

第一步,打开Kimi网页端或最新版客户端,在输入框右下方的模型选择器中切换到K3。K3也已经应用在Kimi Work、Kimi Code和官方API中。

第二步,把任务背景、参考资料和交付格式一次说清楚。比如:

阅读我上传的12份周报和3份会议纪要,先整理本季度项目时间线,再找出延期事项及原因,最后生成一份10页以内的复盘PPT提纲。所有结论都标出来自哪个文件,不确定的地方单独列出。

第三步,不要拿到第一版就结束。继续让它检查遗漏、核对引用、压缩篇幅,或者把内容改成适合汇报、公众号和内部通知的不同版本。

记住一个实用公式:

复杂任务 = 输入材料 + 处理步骤 + 输出格式 + 核查要求。

这四项说得越清楚,AI越不容易跑偏。

四、K3、K2.6和K3集群怎么选?

如果只是问一个简单问题、查资料或改一句文案,响应更快的K2.6通常已经够用。Kimi帮助中心显示,K2.6在聊天场景中不消耗会员额度。

需要处理成套资料、复杂推理、可编辑文档或多步骤任务时,可以切换到K3,但会消耗相应额度。

如果任务涉及大规模搜索、批量处理或很长的内容,可以考虑K3集群。它更像“同时安排多名助手分头工作”,但同样会消耗额度。

五、使用前还要注意什么?

上下文更长,不代表结论一定正确。资料越多,越要要求AI标注来源,并对关键数字回到原文复核。

也不要随意上传合同原件、身份证件、未公开经营数据和公司源码。涉及内部材料时,要先确认单位的数据安全要求和账号权限。

需要说明的是,“开放模型”不等于普通电脑就能轻松本地运行。K3总参数规模达到2.8万亿,官方建议使用由64张以上加速卡组成的超节点配置进行部署。对大多数普通用户来说,更现实的方式仍然是通过Kimi网页端、App、Kimi Work或API直接使用。

写在最后

Kimi K3最值得关注的,不是2.8万亿这个数字本身,而是AI正在从“回答一个问题”,走向“接住一整套项目”。

对普通职场人来说,它未必适合每一次简单对话,却很适合那些资料多、周期长、需要反复核查的重任务。

与其拿它问天气、改句子,不如把积压很久的项目资料交给它,看看它能不能先替你完成第一轮整理。

你最想让Kimi K3接手哪一项重活?欢迎在评论区留言,我可以帮你把第一条指令写好。