玩转AI-千问办公上线一个月用户破3000万

一个月,3000万用户。

9月4日,阿里巴巴披露,千问办公在中国市场公测上线一个月,总用户数已突破3000万,其中超过一半为企业用户。这组由企业公布的数据很抢眼,但更值得关注的是:为什么一款办公AI,会在短时间里吸引这么多人试用?

答案可能藏在一个人人熟悉的麻烦里。过去,我们让AI写一段文字、整理一份摘要、分析一张表,最后仍要自己复制到Word,重新搭PPT,再把数据、图片和格式逐个搬过去。AI负责生成一段,人负责把这一段变成能交付的东西。

千问办公瞄准的正是这段“最后一公里”:让AI少停留在回答框里,开始向文档、表格、PPT、网页和多媒体等可交付成果推进。

一个月3000万 背后不只是多一个聊天框

千问办公由阿里巴巴在8月3日开放公测。官方介绍显示,它整合了Qoderwork、Mulerun和悟空的核心能力,把桌面智能体、云端智能体和企业协作智能体放进同一平台。

这句产品介绍听上去有点技术化,换成日常语言,就是它希望接住一整段办公流程:先读取材料,拆解任务,再调用文档、表格、PPT、网页、图片或视频等能力,最后把结果以文件或页面的形式交出来。

阿里巴巴还称,千问办公首月完成了120个版本更新,推出超过1000项新功能。数量不等于质量,但密集迭代至少说明,办公智能体的竞争已经从“模型会不会答”转向“产品能不能做完”。

它想砍掉的是办公室里的复制粘贴

假设你要做一份项目汇报。传统用法是先让AI提炼材料,再把答案粘进Word;接着请它列PPT大纲,自己去演示软件里重搭;数据还要回到表格里计算,最后再手动统一标题、图表和页面风格。

在千问办公的设想里,这些步骤可以放进同一个任务里:把参考资料交给它,说明汇报对象、页数、重点和输出格式,让它整理材料、生成文档或PPT,再根据反馈继续修改。官方界面还会在任务执行过程中追问输出格式、重点方向等信息,而不是只吐出一段通用答案。

这并不意味着文件拿来就能直接发布。数字、引用、版式和业务判断仍要人工复核。真正节省的是搬运、转换和重复排版的时间。人不一定少做判断,但会少做很多搬运。

网页 桌面 钉钉 三个入口接不同的工作状态

目前,千问办公已提供网页端、桌面端和钉钉内嵌入口。网页端适合临时使用,打开浏览器即可开始;桌面端可以在用户授权后读取本地文档、表格、图片和视频,并将处理结果保存回指定文件夹;钉钉入口更接近团队协作,可结合群聊、日程、文档和企业业务系统处理任务。

三种入口的差别,不只是换了一个登录位置。网页端强调随时可用,桌面端强调本地文件和浏览器操作,钉钉端强调组织数据与协作流程。对于经常在多个软件之间来回切换的人,这种“一个入口接住多种工作”的思路,正是它最有吸引力的地方。

当然,能力并非在每个入口完全一致。阿里云帮助文档注明,浏览器自动化目前仅桌面客户端支持,部分网页制作能力也有端侧差异。使用前仍要看清当前版本和权限,不要把产品总览里的每项能力都理解成所有用户、所有入口立即可用。

放到国内外横向看 千问办公站在什么位置

办公AI已经形成几条不同路线。WPS AI和Microsoft 365 Copilot更贴近传统办公软件,在熟悉的文字、表格、演示和邮件中加入AI;飞书与Gemini for Workspace依托协作平台和云端文档,让AI直接使用团队已有的信息;ChatGPT Work则从通用智能体出发,跨应用、文件和网页完成任务。

千问办公的特点,是把上述几种路线尽量放到同一个入口:既做文档和PPT,也连接本地文件、浏览器和钉钉,还允许把重复任务沉淀为技能或定时任务。它的优势是覆盖面广,挑战也同样明显——链条越长,越考验结果稳定性、权限控制和最终校验。

代表产品主要起点更突出的能力更适合谁
千问办公统一任务入口文档、表格、PPT、网页、本地文件、浏览器与钉钉协同希望减少跨工具搬运的个人和团队
WPS AIWPS文字、表格、演示、PDF在现有Office文件里生成、改写、分析和排版长期使用WPS处理文件的人
飞书AI能力云文档、多维表格、消息与工作流团队协作、数据表、自动化和业务流程资料本来就在飞书中的组织
Microsoft 365 CopilotWord、Excel、PowerPoint、Outlook、Teams结合Microsoft 365应用和组织数据工作已经使用Microsoft 365的企业
Gemini for WorkspaceGmail、Drive、Docs、Sheets、Slides围绕Google Workspace文件和邮件协作以Google云端办公为主的用户
ChatGPT Work应用、文件、网页与桌面任务跨来源整理信息并创建或修改多类交付物工具混用、任务类型变化较多的用户

真正的分水岭 是能不能把成果交出来

办公AI的第一阶段,竞争的是谁回答得更聪明;第二阶段,竞争的是谁能把回答变成可编辑、可继续修改、可进入真实流程的成果。千问办公的出现,把这条趋势摆得很直白。

但“能交付”不等于“可免审”。AI生成的报告可能遗漏来源,表格公式可能不适合实际数据,PPT也可能在逻辑、字号或图片版权上出问题。越接近最终文件,用户越要明确目标、提供可靠材料,并设置检查节点。

更稳妥的使用方式,是把任务说具体:交给谁看、需要什么格式、必须保留哪些数据、哪些内容不能改、最后如何验收。把这些条件写清楚后,智能体才更像一位能持续返工的助理,而不是一次性内容生成器。

普通人现在值不值得试

如果你的工作经常在文档、表格、PPT和网页之间来回切换,千问办公值得试一轮。可以先从低风险任务开始:整理公开资料、把会议笔记变成结构化文档、根据已核实的数据制作一页汇报,或者把重复的信息收集流程做成定时任务。

涉及合同、财务、客户数据和对外发布内容时,应先确认组织权限与数据要求,并保留人工复核。办公智能体真正适合接手的,是规则清楚、材料明确、结果可以检查的任务。

千问办公首月的用户增长,说明很多人已经在寻找一个新答案:当AI不再只给建议,而是开始碰文件、碰系统、碰交付物,我们该怎样重新分配自己的时间?

也许以后判断一款办公AI是否好用,问题不再是“它说得像不像人”,而是“它做出来的东西,我还要返工多少”。

玩转AI——当ChatGPT开始卖广告,AI回答还会不会“纯粹”?

你有没有过这种体验:

打开搜索引擎,输入”哪款手机拍照最好”,结果前三条全是广告。你往下翻,才找到真正的内容。

那如果换成ChatGPT呢?

你问它同样的问题,它给你一段条理清晰、语气中立的回答,告诉你A款拍照最好、B款性价比高、C款适合视频。你正要接受这个建议,眼角余光扫到下方一行小字——”赞助内容”。

这时候,你还信不信它的判断?

一、先从那个10亿美元的数字说起

今年8月31日,OpenAI宣布,ChatGPT Ads的年化收入运行率(annualized run rate)达到了10亿美元。简单换算一下,就是它现在通过广告,每天能赚大约270万美元。

这个数字第一次看到时挺吓人的——一家年轻的AI公司,广告流水已经赶上了不少老牌媒体。

但仔细看,这10亿美元不是凭空来的。从今年2月在美国小范围测试,到随后逐步向更多国家和免费用户铺开,再到8月底跑通商业模型,OpenAI用了大约半年时间,把广告从”实验”变成了”生意”。

用户端能看到的变化是:当你使用ChatGPT免费版或每月8美元的Go套餐时,部分回答下方会出现一个标注为”赞助内容”的卡片。它不遮答案、不弹窗、不打断对话,只是安安静静地待在那里。

但问题也恰恰出在”安安静静”这四个字上。

二、AI广告,和搜索广告到底有什么不同?

你可能会想:搜索引擎不也卖广告吗?Google首页那么多广告位,怎么没人担心”答案不纯粹”?

区别在于,搜索广告和自然结果是并列的。用户看到广告,也看到它旁边的自然链接,可以选择点哪个。而且在搜索结果的排序里,通常有付费、权威、时效性、相关性的多重信号,用户能直观判断哪些是广告、哪些是原生结果。

而AI对话不一样。ChatGPT给的是一个整合好的结论——没有多个链接让你挑,没有排序让你判断。它直接告诉你”答案是什么”,语气流畅、格式整齐,几乎不带任何不确定性。

当这个结论下方紧跟着一条赞助推荐时,绝大多数人不会有意识地去质疑:”这段答案是不是还纯粹?”因为AI的答案本身是独立生成的,但赞助内容就放在答案正下方,阅读习惯会让读者自然顺着答案往下看。

这种影响极其隐蔽。

三、真正值钱的,不是”关键词”,是”意图”

Google卖广告,卖的是”关键词”——你搜”洗衣机”,它卖洗衣机广告。

短视频卖广告,卖的是”兴趣”——你爱看猫,它推猫粮。

但ChatGPT卖广告,卖的是“意图”

什么叫意图?就是你问”我要给孩子选暑假课程””帮我挑一台办公电脑””哪家医院的眼科最好”的时候,你的消费决策已经走到最后一步了。你不是在随便逛逛,你是在做决定。

这时候,一个看起来中立、权威的AI回答,加上紧贴着答案的赞助推荐,会产生非常强大的影响。它不是打断你,而是在你最需要信任一个推荐的时候,正下方就有一份。

这种”决策前一秒”的商业入口,比搜索关键词或算法推荐都更接近成交。

这就是为什么广告主愿意为这个位置付钱。

四、OpenAI做了哪些区分,够不够?

OpenAI当然也知道这种顾虑。它在官方说明里列出了几道防线:

1. 广告有清晰标注。每个广告都标了”赞助内容”或”sponsor”,视觉上与回答区隔开。

2. 广告不影响回答。广告系统与聊天模型独立运行,广告主无法干涉ChatGPT的答案,也无法访问用户的对话记录。

3. 敏感话题不展示广告。涉及健康、医疗、心理健康、政治等敏感话题时,广告会自动屏蔽。

4. 用户有控制权。可以在设置里关闭广告个性化(不让广告参考你的聊天记录和记忆),也可以删除广告数据。

5. 免费用户可选择免广告。在设置里关闭广告后,免费版用户将不再看到赞助内容,代价是每日消息限额会被调低。

6. 未成年人账户、临时聊天(Temporary Chats)模式不显示广告。

这些措施听起来很完善。但回到实际使用场景,问题仍然存在:当用户看到一个流畅、清晰、值得信赖的AI回答时,会不会下意识地认为它下方的赞助内容也同样值得信赖?

这个问题的答案,不在OpenAI的官方说明里,而在每个用户的实际使用习惯里。

五、普通人该怎么办?

我不认为ChatGPT Ads是AI的末日,也不是OpenAI的背叛。免费的互联网服务,最终总要有人买单。过去是搜索广告,现在是AI广告——这本身没什么好惊讶的。

但有几件小事,你可以留意一下:

1. 看到”赞助内容”四个字,要知道那是付费推荐,与AI回答本身无关。OpenAI的答案确实不受广告影响,但付费推荐不会影响回答、却会影响用户——这种影响可以非常隐蔽。

2. 涉及健康、医疗、金融、教育这类选择,多查一手来源。不要把AI的流畅表达等同于客观结论,它只是一个参考。顺藤摸瓜去查原始资料,或者至少对比几个不同的来源,仍然是非常必要的验证步骤。

3. 不想看广告,有办法。升级到Plus或Pro(全程无广告);或者在免费版设置里关闭广告(代价是每日消息限额被调低);又或者使用临时聊天模式(不显示广告)。

最后想说一句:以后你再问ChatGPT一个问题,看到它给出的答案时,不妨多问自己一句——如果这个答案下面出现了付费推荐,我还能分得清,什么是独立的判断、什么是商业的引导吗?

这个问题的答案,可能比10亿美元的年收入,更值得我们关心。

玩转AI——Codex实战:一套小学 AI 课件,我是怎么和 Codex 来回改了 7 轮的

很多人以为,让 AI 做 PPT,就是输入一句“帮我生成课件”,然后等它吐出一份成品。

但这次做“小学人工智能通识课”时,我发现真正有价值的不是第一次生成,而是后面一轮轮把它改到能用。

这次实验对象是一套小学 AI 通识课课件:把教学方案和实验操作手册,变成 15 页、16:9、可编辑、能直接进教室使用的 PPT。

我不是让 Codex 随便做一套“看起来像课件”的 PPT,而是不断给它加条件、挑问题、控制用量、缩小修改范围,再让它回去重做。最后成品能落地,靠的不是一句神奇提示词,而是一段很具体的人机协作过程。

第一轮:先问清楚,应该怎么向 AI 提需求

一开始,我手里有两个文件:教学方案和实验操作手册。

如果直接把文件丢给 AI,说“帮我做 PPT”,结果很容易发散:它可能把教师话术放进学生课件,也可能把实验步骤堆成说明书。

所以第一步,我没有急着让 Codex 生成成品,而是先问它:如果要依据这两个文件制作教学 PPT,应该给出怎样的提示词。

这个动作看似绕了一步,其实很关键。

AI 很擅长执行,但前提是任务边界清楚。与其一上来就让它做成品,不如先让它把“应该怎样下任务”讲清楚:用哪些文件、生成多少页、哪些截图能用、哪些内容不能进学生课件。

这一步相当于先把工作说明书写出来,再让 AI 开始干活。

第二轮:控制页数和用量,不让它一上来就“豪华装修”

后来我逐渐把要求收紧:15 页就可以,不要做太大,避免浪费用量;要配图,但不能为了配图而配图。

我还特别强调:不要把每一页都做成整张 AI 背景图。整页图看起来热闹,但修改成本高,用量也大,一旦文字错了、版式不合适,就很难继续精修。

最后,约束变成了一套更明确的规则:15 页、16:9、可编辑 PPTX;浅色背景;每页只讲一个核心点;不生成演讲者备注;不把年级、课时、教学目标、教师话术、设计意图放进学生课件;实验页优先使用真实截图,概念页再使用辅助小图。

这些要求看起来像细节,其实是在给 Codex 画边界。

如果没有这些边界,它很可能会做出一份“内容很多、看起来也完整”的课件,但小学生看不懂,老师上课也不好用。把标准提前说清楚,后面的生成、修改和质检才有依据。

第三轮:配图策略改成“局部小图”,而不是整页 AI 大图

做儿童课件时,很容易掉进一个坑:页面很可爱,但图和知识点没关系。一开始,整页 AI 图看起来很漂亮,可问题也明显:用量大、修改难、容易盖住文字。

于是我改了要求:能不能不要局部生小图?比如需要一台电脑,就只生成一台电脑;需要麦克风、耳朵、声波,就只生成这些透明背景小插画,再嵌入 PPT。

这个方法明显更适合课件生产。

它不是让 AI 每页画一张“大海报”,而是先设计好页面版式,再按需要补小图。这样既节省生成次数,也方便后面调整:文字可以改,图片可以挪,实验截图也能保持真实。

后来这套思路变成了一个稳定分工:概念页用局部小图解释抽象概念,实验页用真实截图保证可复现,总结页用少量图标帮助学生记住步骤。

第四轮:第一版出来后,我开始挑毛病

第一版出来后,并不等于完成。

我继续看预览挑问题。很多问题不是“大错”,但会直接影响课堂使用。

比如,有的页面右下角有编号,我要求删掉;有的页面是空记录表,看起来像让学生填,但其实没有教学意义,我要求改成能直接判断的“证据卡”或“情境判断页”;有的课件第 8 页、第 14 页内容太空,我要求重做;还有一次我只想改“手势”那一套,不想影响另一套,Codex 就必须停下来缩小修改范围。

下面这张表记录了其中几轮具体的修改和响应:

我提出的问题Codex 后续处理
右下角编号删掉删除整套 PPT 右下角页码
第 9 页不要空记录表改成有实例推理链的页面
手势第 8 页也要改改成“位置变化的对照路径”
手势第 14 页不要空表改成“改进前后看什么证据”
只要手势的缩小修改范围,不动另一套
第 14 页文字少一些保留判断逻辑,压缩重复解释

这几轮对话很重要。

因为很多 AI 工具最容易出问题的地方,不是第一次不会生成,而是用户提出具体修改后,它会不会改错对象、会不会把已经确认的部分又弄乱。

第五轮:发现后半段没设计感,继续返修

做课件还有一个很常见的问题:前几页因为是开场,往往设计得比较好;越到后面,页面越容易变成普通文字堆叠。

我看到后半段设计感明显下降,就继续指出:前几页还有点设计,后面完全没有设计感了。

Codex 后续不是简单换个背景,而是重做后半段结构:把实验操作页改成交替场景,把结果页强化视觉层级,把总结页改成更清楚的关卡或任务台。

这一步让我感觉,它更像一个可以持续返工的制作助理。

我说“这里不好”,它需要理解“不好”具体指什么;我说“后半段没有设计感”,它需要判断是配色问题、结构问题、留白问题,还是页面节奏问题。

这比单纯生成一份 PPT 更接近真实工作。

第六轮:把抽象问题,改成孩子能进入的故事

这套课件里有一节叫《AI 做的事情都是对的吗?》。

如果直接讲“AI 可能存在语义理解偏差”,小学生大概率听不进去。Codex 最后选择了更生活化的切口:翻译耳机闹笑话。

比如,“我们班卧虎藏龙”不能按字面翻成教室里真的有老虎和龙;“piece of cake”在语境里不是一块蛋糕,而是“这件事很容易”;“放鸽子”也不是把鸽子放走,而是没有按约定出现。

这样一来,学生先被问题吸引,再自然进入结论:AI 翻译看起来每个词都翻出来了,但整句话仍然可能错。

这个设计比“直接讲概念”更适合孩子。它不是先告诉学生一个抽象结论,而是先让学生发现:咦,明明每个词都翻了,为什么听起来这么怪?当孩子自己先发现问题,再讲“语境”和“核查”,就不再像灌输知识,而像是在解决一个真实小谜题。

第七轮:不是堆页面,而是设计一条课堂路径

最后的课件不是把材料平均分成 15 页,而是按课堂节奏重新组织。

这时距离最初那两份教学材料,已经不是简单“换个格式”的变化,而是变成了一套有开场、有任务、有实验、有收束的课堂作品。

先用几个“翻译闹笑话”的场景制造好奇心;再用一页最小理论说明“原话和语境进入 AI,译文会影响对方理解”;接着给出四步核查方法:读完整句子、联系语境、圈出可疑表达、说出实际意思;最后进入真实实验,让学生观察“核查前后剧情有没有变化”。

也就是说,Codex 做的不是“把文字放进 PPT”,而是把材料整理成一条学生能走下去的学习路线。

最后不是交文件,而是做质检

最容易被忽略的,其实是最后一步。

Codex 在生成 PPT 后,还要逐页检查:标题有没有异常换行,文字有没有溢出,图片有没有被裁切,实验截图是否清楚,页面左右留白是否均衡,是否出现了不该给学生看的教师端内容。

例如在另一节《AI 怎么认出一张脸》的课件中,质检还专门检查了几个边界:24/24 和 6/6 只能写成学习进度,不能误写成准确率;0.94 不能写成身份置信度;人脸数据要提醒只在课堂内使用、不上传、不传播。

这一步其实最像一位谨慎的助教:它不只负责“做出来”,还要负责“别出错”。所以这次交付前,真正省时间的不是第一版生成,而是后面的反复检查、定位问题和局部返修。

这次实验真正有价值的地方

这次让我感觉比较明显的是,Codex 更适合承担“长链条制作”里的中间层工作。

如果人的角色是定方向、审关键、做最终判断,把重复整理、初稿搭建和细节检查交给 Codex——这种分工,比“让它一口气做完”更接近真实可用。

下次再做类似课程时,我不会只问 AI:“帮我做个 PPT。”

我会更具体地问它:“请先判断学生能看什么,再把这节课设计成一条孩子能走完的学习路线。”

这个问题,才真正接近一套好课件的起点。

玩转AI——Codex 实战:一篇公众号稿背后的 AI 协作流程

很多人第一次用AI 写文章,都会有一种很熟悉的快乐:输入一句需求,几秒钟后,一篇稿子就出来了。

但真正做过公众号的人都知道,麻烦往往不在“第一版文字”。麻烦在后面:选题要不要换,事实要不要核,图片对不对,排版能不能复制,领导临时改方向怎么办,最后文件夹里是不是只剩能交的版本。

这次“玩转AI”没有继续写某个新工具发布,而是把一段真实的稿件制作对话拿出来,当成一个案例:看看 Codex 这类智能体,能不能把一篇内容从“差不多写完”继续推到“真的能发”。

Codex 是 OpenAI 面向复杂任务、代码和文件协作场景的智能体。在授权的工作区里,它可以读取项目材料、生成或修改文件,并按规则持续推进任务。放到内容生产里,它不像一个只会写几段话的助手,更像一个会跟着你一起返工的执行搭子。

一、真正的开始,不是“帮我写一篇”

如果只让AI 写正文,这件事其实没什么新鲜。真正有意思的是,这次任务一开始就不是“写一篇稿”,而是“按一套固定流程交付”。

对话里先定下了很多边界:选题阶段只给候选,不写全文;用户只回复序号后,才进入正式写稿;公开稿里只保留读者需要看到的内容;图片不能是泛泛的科技氛围图;公众号版字号也要统一。

这一步看起来啰嗦,但它解决的是内容工作里最常见的问题:人以为自己说清楚了,AI 以为自己听懂了,最后交出来的东西却总差一点。

二、需求会变,AI 也得能跟着变

真实工作很少一条指令走到底。中途,稿件方向变了:原来准备写“入口介绍”,后来改成 Codex 使用类文章;原来想用第一视角,后来又发现读者可能更接受案例拆解。

这就是内容生产最真实的样子:不是需求一开始就完美,而是写着写着,方向、口吻、配图、格式都在变。

如果AI 只能写第一版,它会在这里失效。Codex 的价值,是能把新要求并回原来的交付规则里:主题换掉,文章重写,配图重配,Word 和公众号版也一起改。

三、另一轮审稿,不是走形式

这次还有一个关键环节:不是Codex 自己写完自己夸自己,而是把稿件发到 DeepSeek 的“每周新闻”对话里,让另一个模型挑问题。

DeepSeek 第一轮意见很直接:稿子太像内部复盘,读者不一定关心“我怎么工作”;开头缺少 Codex 基础介绍;“跑完整流程”的说法容易让人误以为全自动;标题也不够像公众号新闻。

这些意见没有被机械照收。Codex 随后逐条回应:该补的补,该弱化的弱化,但也保留真实案例里的过程感。最后稿子才从“内部复盘”往“读者能用的案例”靠近。

四、最像真实工作的,是反复改图

写稿过程中,返工最多的其实不是标题,而是图片。

先是配图太泛,后来又被指出“不是内容相关”;有的图文字太空,有的图像单独人物图,有的界面是英文,有的地方还要检查文字溢出。最后,截图要求又变成:直接用真实对话视角。

这很真实。公众号文章不是把正文贴上去就结束,图片承担的是“让读者相信你真的跑过流程”的作用。尤其是讲 AI 使用案例时,越是抽象的能力,越需要具体的过程截图来落地。

五、最后剩下的,是那些最容易忘的小事

把一篇稿子做到最后,最怕的不是没有正文,而是各种小问题堆在一起:Word 改了,公众号版没改;图片换了,网站小图没压;公开稿里混进了不该给读者看的说明;文件名看着差不多,真正交付时又找不到最终版。

Codex 适合接手的,恰好是这些“单件不难、合起来很烦”的工作。

它能把交付物当成一组文件来看:Word 定稿、公众号排版 HTML、配图原图、网站压缩图、事实核查记录。更重要的是,它会按检查清单回头看一遍:图片数量对不对、网页字号对不对、公开稿有没有多余内容、文件能不能打开。

、普通人可以怎么用?

如果你也想把一项重复工作交给AI,不要一上来就说“帮我做完”。可以先这样开口:

我想把【某项重复工作】做成一条可复用流程。请你先不要直接产出最终结果,先帮我拆成:输入材料、确认节点、可自动执行的步骤、需要人工判断的步骤、最终交付物、交付前检查清单。等我确认流程后,再开始执行。

这句话的关键,是先让AI 学会“什么时候不能乱动手”。

等规则稳定下来,AI 才不只是一个写作按钮,而会变成一个能陪你把事情做完的搭子。它不替你拍板,但能帮你少漏很多细节。对每天都要交稿、交表、交方案的人来说,这可能比“写得更快”更实际。

玩转AI-MiniMax H3开放权重:图片、视频和声音,现在可以一起交给AI

过去做一条AI视频,常常要把图片交给一个工具、声音交给另一个工具,再用剪辑软件把它们拼起来。MiniMax H3想解决的,正是这种“素材各管一段”的麻烦:文字、图片、视频和音频可以作为同一组参考材料,一起参与视频生成。

对普通用户来说,这次更新值得关注的不是又多了一个模型名字,而是做视频的入口正在变得更像一次完整的内容创作。

一、H3已经能用,而且不只停留在发布会里

MiniMax在7月31日发布H3,把它定位为通用多模态视频模型。现在,用户可以从海螺AI的H3官方页面直接进入体验;开发者也可以通过MiniMax开放平台调用模型。与此同时,ComfyUI已经原生支持H3开放权重工作流,可以在本地部署文本生视频、图片生视频和参考素材生视频等流程。

这里要分清两件事:在线平台和API更适合普通用户,操作门槛低;开放权重更适合有显卡、懂模型部署的人。开放权重不等于“任何电脑都能轻松跑”,更不等于生成完全免费。

二、它把四类素材放进了同一个“上下文”

过去给视频模型下指令,最常见的是一段文字,或者一张首帧图片。H3进一步支持把文字、图片、视频和音频放在一起,让模型同时参考人物外观、动作节奏、镜头语言和声音氛围。

比如,你可以提供一张产品图、一段运镜参考和一段背景音乐,再用文字说明“镜头从近景慢慢拉远”。模型面对的不再是一句孤零零的提示词,而是一套更完整的创作条件。

官方资料显示,H3可生成带原生立体声的视频;在线平台和API支持4至15秒、768P或2K输出。这里的“2K”指在线平台或API能力,不应直接套到本地开放权重工作流。ComfyUI官方教程注明,本地原生画布以短边768像素为基准,并有画布上限。

三、普通人最容易上手的,是这三种做法

1. 只写文字:先把想法变成短片

适合没有现成素材、只想快速试创意的人。写清主体、场景、动作、镜头和声音,比堆砌“电影感”“高级感”更有效。

2. 给首尾画面:让变化过程更可控

如果你已经有一张开场图和一张结束图,可以让模型补出中间过程。产品展示、海报动效和简单转场,都可以从这种方式开始。

3. 同时给参考图、视频和音频:让结果更接近你的目标

这是H3最有代表性的用法。参考图负责人物或产品外观,参考视频负责动作和运镜,参考音频负责节奏和声音风格。素材越多不一定越好,关键是每份材料分工明确,彼此不要冲突。

四、“开放权重”让它多了一条本地路线

对于普通读者,开放权重最实用的理解是:除了在网页上点按钮,还可以把模型下载到自己的设备或服务器里,通过ComfyUI等工具搭建工作流。这样更便于批量处理、接入内部流程,也能减少素材在多个在线工具之间来回传递。

但本地运行要付出显卡、存储、部署和维护成本。你还需要自己处理模型文件、工作流节点和参数设置。对只偶尔做几条短视频的人,先用在线入口通常更省事;对需要稳定批量生产、希望掌控工作流的人,本地部署才更有意义。

五、别只看榜单,先看它能不能完成你的任务

官方页面展示了H3在多项视频生成与编辑评测中的表现,但榜单会随样本和新模型更新。对普通用户而言,更有用的判断标准是三个:人物和产品是否保持一致,动作和镜头是否听指令,声音与画面是否真的同步。

第一次尝试时,可以从5秒左右的小任务开始:只放一到两份关键参考,先测试主体和动作,再逐步加入声音、运镜和更多素材。这样更容易判断是哪一项条件影响了结果,也能少花不必要的生成额度。

还要注意,上传他人照片、声音或品牌素材前,应先确认肖像、声音和版权授权。模型能合成,不代表内容就自动具备发布许可。

H3真正有意思的地方,不只是“又能生成更清晰的视频”,而是把图片、视频、声音和文字放进了一次创作里。过去需要在多个工具之间接力的流程,正在被压缩成一个更统一的入口。

如果你只是想让一张照片动起来,在线页面已经足够;如果你要把参考素材、声音和批量流程结合起来,再考虑API或本地开放权重。先从最小任务开始,往往比一次把所有功能都塞进去更容易得到可用结果。

玩转AI——AI也开始开项目组了:腾讯云多 Agent 协同,让“一个助手”变成“一个项目组”

过去用 AI,常常是你把一件事交给一个助手,从头问到尾。现在,腾讯云把“组队干活”搬进了智能体:一个主 Agent 当队长,多个子 Agent 分头研究、互相沟通,再把结果汇总回来。

先把对象说清楚:腾讯云近期介绍的这项能力,不是普通员工直接使用的“智能工作台”,而是腾讯云智能体开发平台 Claw 模式面向需要配置 AI 应用的技术人员或开发者提供的多 Agent 协作能力。

Claw 可以理解为平台里一种能自主规划、调用工具并完成多步骤任务的应用模式。听起来有点技术,换个说法就是:以前你请了一位全能助理;现在,这位助理可以临时拉一个项目群。

一、AI“小组作业”到底怎么分工?

这种“组队”也分两种。

最基础的是“单向委派”。它像项目经理分配:你设置一个主 Agent,再给它配几个角色不同的子 Agent。主 Agent 先理解任务,把工作拆开;子 Agent 各自完成后,把结果交回主 Agent,由它统一整理。组员之间不用互相讨论。

比如你要做一份竞品报告,可以让 3 个子 Agent 分别研究价格、功能和用户评价。它们不用互相聊天,最后把材料交给主 Agent 就行。这种方式适合需要分头推进、但成员之间不必反复沟通的任务。

如果任务更复杂,需要成员互相追问、质疑和接力,就可以在配置应用时进入高级设置,手动打开“允许多 Agent 团队协作”开关。这是应用配置,不是聊天过程中临时打开。

开启后,子 Agent 不只会向主 Agent 汇报,还能直接与其他子 Agent 沟通。官方目前允许一个团队最多包含 1 个主 Agent 和 19 个子 Agent。

但先别急着把 19 个位置都坐满。开了团队协作,也不代表每个任务都会自动组队;系统会根据任务需要决定是否启用。AI 团队和真人团队一样,人多不一定效率高,角色不清反而更容易乱。

二、三个普通人能用上的场景

场景一:做一篇需要核实的内容

假设你要写一篇公众号新闻,可以这样分工:

• 资料 Agent:收集最近 7 天的候选信息,并附上官方来源;

• 核实 Agent:检查日期、产品状态和收费规则;

• 审稿 Agent:专门找夸大、歧义和过时信息;

• 主 Agent:负责写作、取舍和最终确认。

这里有一个关键点:不要让好几个 Agent 同时改同一篇正文。腾讯云官方也提醒,多 Agent 同时编辑同一内容容易产生冲突。更稳妥的做法,是让它们分别提供材料和意见,最后只由一个 Agent 执笔,再由人确认。

场景二:做一次多角度调研

买设备、选供应商、做课程调研时,可以让不同 Agent 各看一个方向:一个查价格,一个查服务,一个找案例,一个专门验证风险。

单个 AI 很容易顺着第一条思路一直说下去。角色分开后,相当于多了几双眼睛,尤其适合互相挑战结论。

场景三:做一个小型应用

再往技术场景走一步,如果你要做网页或内部工具,可以让前端 Agent、后端 Agent、测试 Agent 分工。测试 Agent 发现问题后,可以直接把问题发给对应成员,不必每次都绕回主 Agent。

这类需要交接、反馈和返工的任务,才真正体现“团队协作”的价值。

三、什么时候别开团队协作?

第一,问题很简单时不要开。

查一个概念、改一段话、整理一张表,一个 Agent 就能完成。为了显得高级而组队,往往只会多绕几圈。

第二,流程完全按顺序进行时,不一定要开。

如果第二步必须等第一步结束、第三步又只能等第二步,普通工作流可能更清楚。

第三,要留意成本。

腾讯云官方提示,开启团队协作后,Token 消耗大约是单向委派的 2—3 倍。Token 可以简单理解为 AI 处理信息的计量单位,参与的角色越多、沟通越频繁,通常就会消耗更多。

从 7 月 1 日起,智能工作台和 Claw 模式应用运行任务均已结束限时免费公测,转为按运行时长计费;模型、工具和 Skills 还会消耗 PU。PU 是平台的通用计费单位,官方当前换算为 1 PU=0.001 元。实际价格可能调整,正式使用前应以计费页面为准,并先用小任务测试效果和费用。

怎么选,可以记住三句话:

简单问答,用单 Agent。

需要分头查资料,用单向委派。

需要互相追问、接力和返工,再开团队协作。

多 Agent 最值得关注的,不是“同时叫来更多 AI”,而是把过去藏在一个对话框里的工作过程,变成可以分工、交接和检查的流程。

它不会自动让结果变好。真正决定质量的,仍然是角色有没有分清、资料来源靠不靠谱,以及最后有没有一个人负责拍板。

如果让你组一支 AI 小队,你最先会设置哪三个角色?欢迎在评论区告诉我。

玩转AI——Kimi K3来了:这次不只陪你聊天,而是想接住一整套项目

2.8万亿参数、原生视觉、最高100万Token上下文——Kimi K3的数字很醒目,但普通用户真正需要关注的,是它能否读完一整套资料,并把调研、分析、文档和编程等长任务持续做下去。

前几期我们聊过桌面智能体、零代码应用,也聊过能围绕资料做研究的AI工具。本期轮到国产大模型里的“长文本老选手”Kimi。

7月16日,月之暗面发布新一代旗舰模型Kimi K3。官方公布的几个数字很抢眼:2.8万亿参数、原生视觉能力、最高100万Token上下文,并重点面向长程编程、知识工作和复杂Agent任务。

一、Kimi K3升级的重点是什么?

先说结论:K3的重点不是让简单聊天变得更花哨,而是提高处理“重任务”的能力。

过去用AI做复杂项目,经常遇到三个问题:资料一次放不全、对话长了忘记前文、任务步骤一多就开始跑偏。

K3把上下文上限提高到100万Token,适合处理大型代码库、成套项目文档和多份研究资料。这里要注意,100万Token是模型支持的上限;网页端需要相应的高等级会员权益,并不是所有账号默认开放。

它还原生支持图片理解。除了文字、表格和文档,你也可以把截图、图表、流程图一起交给它,让模型结合图文分析,而不是只读其中的文字。以前分析竞品页面,需要先用文字描述页面结构;现在可以直接把网页截图交给K3,让它结合页面布局、图表和文字一起分析。

至于KDA、Attention Residuals和MoE这些技术名词,普通用户不用背。它们最终想解决的都是同一件事:资料更多、任务更长时,模型仍能尽量保持思路连贯。

二、普通人可以用它做什么?

1. 给一整套项目资料做复盘

把几个月的周报、会议纪要、方案和数据表放进去,让它按“目标—进展—问题—下一步”整理,并找出前后矛盾和长期没有解决的事项。

以前我们需要在十几个文件之间来回翻,现在可以先让AI完成第一轮梳理,再由人核对关键结论。

2. 横向比较多份报告

一次上传多份行业报告时,不要只说“帮我总结”。可以直接要求:

比较这些报告的共同判断、主要分歧和数据口径;每条结论标出来源;最后给出三条可执行建议。不确定的信息单独列出,不要自行补全。

这样得到的结果,更接近一份可以继续加工的调研底稿。

以前同时看几份报告,最费时间的往往不是阅读,而是核对同一指标是否采用同一口径;先让AI把差异列出来,人再回到原文确认,可以省掉大量来回翻找的时间。

3. 从资料直接做到成品

K3不仅能输出文字,还可以参与生成文档、表格、PPT和网站等可编辑成果。

例如,你可以让它先读取会议材料,再整理汇报逻辑、制作演示文稿提纲,最后检查遗漏。这种工作方式更接近“把整个任务交给AI”。

以前最容易卡在“内容已经有了,但还要重新整理成不同格式”;现在可以让AI沿着同一套材料继续往下做,减少在文档、表格和PPT之间反复复制粘贴。

4. 处理周期更长的编程任务

对开发者来说,K3更明显的优势是读取大型代码库,并持续完成修改、测试和排错。

普通用户即使不写代码,也可以关注这一点。因为模型能否长期稳定执行编程任务,也会影响它完成多步骤办公任务时的可靠性。

过去处理长任务时,模型常常做到一半就忘了前面的约束,还需要人工反复提醒;K3想提升的,正是这类持续执行能力。

三、怎么开始使用?

第一步,打开Kimi网页端或最新版客户端,在输入框右下方的模型选择器中切换到K3。K3也已经应用在Kimi Work、Kimi Code和官方API中。

第二步,把任务背景、参考资料和交付格式一次说清楚。比如:

阅读我上传的12份周报和3份会议纪要,先整理本季度项目时间线,再找出延期事项及原因,最后生成一份10页以内的复盘PPT提纲。所有结论都标出来自哪个文件,不确定的地方单独列出。

第三步,不要拿到第一版就结束。继续让它检查遗漏、核对引用、压缩篇幅,或者把内容改成适合汇报、公众号和内部通知的不同版本。

记住一个实用公式:

复杂任务 = 输入材料 + 处理步骤 + 输出格式 + 核查要求。

这四项说得越清楚,AI越不容易跑偏。

四、K3、K2.6和K3集群怎么选?

如果只是问一个简单问题、查资料或改一句文案,响应更快的K2.6通常已经够用。Kimi帮助中心显示,K2.6在聊天场景中不消耗会员额度。

需要处理成套资料、复杂推理、可编辑文档或多步骤任务时,可以切换到K3,但会消耗相应额度。

如果任务涉及大规模搜索、批量处理或很长的内容,可以考虑K3集群。它更像“同时安排多名助手分头工作”,但同样会消耗额度。

五、使用前还要注意什么?

上下文更长,不代表结论一定正确。资料越多,越要要求AI标注来源,并对关键数字回到原文复核。

也不要随意上传合同原件、身份证件、未公开经营数据和公司源码。涉及内部材料时,要先确认单位的数据安全要求和账号权限。

需要说明的是,“开放模型”不等于普通电脑就能轻松本地运行。K3总参数规模达到2.8万亿,官方建议使用由64张以上加速卡组成的超节点配置进行部署。对大多数普通用户来说,更现实的方式仍然是通过Kimi网页端、App、Kimi Work或API直接使用。

写在最后

Kimi K3最值得关注的,不是2.8万亿这个数字本身,而是AI正在从“回答一个问题”,走向“接住一整套项目”。

对普通职场人来说,它未必适合每一次简单对话,却很适合那些资料多、周期长、需要反复核查的重任务。

与其拿它问天气、改句子,不如把积压很久的项目资料交给它,看看它能不能先替你完成第一轮整理。

你最想让Kimi K3接手哪一项重活?欢迎在评论区留言,我可以帮你把第一条指令写好。

探新AI-知识库越用越乱?HyperGraph说:让文档自己“拉帮结派”

企业做 AI 知识库,常常遇到一种尴尬:上万份合同、规范、报告整整齐齐码在系统里,看着挺全,真到用的时候 —— 想找跟某个项目相关的所有资料,搜出来一堆碎片,东一榔头西一棒子,拼都拼不起来。

有没有一种可能:知识库自己管理自己?

现在的知识库,为什么越用越鸡肋?

市面上的主流工具,路子就两条,各有各的坑。

一条是向量检索。把每份文档切成小段,做语义匹配。优点是省事,缺点是文件之间完全不连通。同一个客户出现在合同 A 和报告 B 里,系统根本不认识,跨文件查资料全靠人工手动翻找。

另一条是固定图谱。实体、关系都靠人一笔一笔标进去,精度高,但维护成本更高。业务迭代快的团队,每周都要花大量人力去补节点、建新边,一不留神就滞后。知识断层一旦出现,AI 给出来的东西就少胳膊少腿。

说白了,两类工具都缺一个能力 —— 自己长大、自己更新的能力。 知识库建完的那天,就是它开始变旧的那天。

玩转AI——Gemini Notebook是我工作里最常用的AI之一,尤其是做PPT的时候

你以为它只是笔记本,其实能读资料、跑数据——Gemini Notebook来了

Google出品,把PDF、网页、表格和视频丢进去,不仅能读,还能总结、对比、画图、出成品

7月16日,Google正式把NotebookLM更名为Gemini Notebook。

名字像是换了块门牌,真正的升级却在后厨:部分付费用户已经能让它在安全云端环境中运行代码,资料分析从“帮你看懂”进化到“帮你算完”。

之前我们聊过桌面智能体、聊过文件生成工具,各有各的擅长。但Gemini Notebook切入的是另一个场景——你不是要它凭空编东西,而是要它先把你喂的材料吃透,再替你干活。

一句话概括新能力:把PDF、网页、表格和视频丢进去,Gemini Notebook不只帮你读,还能围绕原始资料做总结、对比、画图表、导出成品文件。

一、怎么用

第一步,建一本笔记。登录Gemini Notebook,新建项目,把PDF、Word、PPT、CSV、网页链接、YouTube视频或录音一次性丢进去。每个项目独立管理,资料不会在不同笔记之间乱串。

第二步,直接说人话。 别只问“总结一下”,试试这样下任务:“对比三份报告的共同结论和冲突点,每条都标出来源”“把这张CSV按月份分析,找出异常波动并解释原因”。回答会附资料引用,方便你回到原文核对。

第三步,到Studio里收成品。 你可以生成简报、思维导图、测验、音频解读、数据表或演示文稿。已开放云端计算能力的账号,还能让它运行代码、画图表、导出Excel、PPT、Word等文件。

 二、场景示例

备课做课件:上传教材、政策文件和几篇论文,让它先列知识框架,再生成课堂提问、随堂测验和讲解提纲。以前资料在文件夹里“各过各的”,现在终于肯坐下来开会了。

项目复盘:放入周报、会议纪要和数据表,要求它找出目标偏差、关键原因和下周行动。数据多时,再让它画趋势图,省掉手动筛表和拼结论。

快速吃透新领域:把行业报告、公开课视频和访谈录音放进一本笔记,先听音频概览,再沿着引用追问。适合调研、考试复习,也适合临时接到一个完全陌生的项目。

三、注意事项

改名不等于所有新功能同时到账。云端运行代码目前优先面向Google AI Ultra和部分Workspace商业用户,未来几周逐步覆盖Pro网页用户。普通用户仍可使用资料上传、基于来源问答和Studio内容生成功能。

AI回答有引用也不代表绝对正确,正式材料仍要回原文复核。上传内部资料前,确认好账号权限和分享范围。

最后聊两句

市面上AI工具分两类:一类帮你“凭空造”,一类帮你“从材料里挖”。Gemini Notebook稳稳站在后者。

它不是让你跟AI闲聊,而是让你把资料扔进去、下命令、然后拿走成果。之前我们聊的桌面智能体是帮你操控电脑完成多步骤操作;腾讯元宝是一句话生成PPT和表格;百度秒哒是零代码搭应用。Gemini Notebook做的事不一样——它解决的是“围绕一堆资料深挖、追问、出成果”这件事。

改名只是开始。Gemini Notebook最值得关注的,是“资料库”开始长出真正的执行能力——从“读懂”到“算完”,Google把它塞进了一本笔记本里。**你最想把哪一堆资料塞进Gemini Notebook?评论区聊聊,我帮你把第一条指令写好。

玩转AI-本周重磅开源!美团LongCat-2.0来了,万亿参数+国产算力自主训练

美团出品,1.6万亿参数MoE架构,MIT协议免费商用,纯国产算力训练

往期我们聊的Coze 3.0、百度秒哒,都是面向普通用户的上层应用工具。本周换个视角——AI行业迎来一个底层技术里程碑事件。

7月6日,美团LongCat-2.0正式开源,国内首款全程依托国产算力集群完成训练、推理的万亿参数混合专家大模型。对企业私有化部署、开发者二次开发具备极高价值。

一、LongCat-2.0是什么?

总参数1.6万亿,MoE混合专家架构,单Token动态激活480亿参数,原生支持百万字超长上下文读取。

6月底完成技术发布,本周正式开放完整权重、推理代码、微调工具。采用MIT开源协议,不限企业商用。华为昇腾、摩尔线程、沐曦等国产芯片同步完成适配,普通高配服务器也能本地离线部署。

最大亮点:依托五万卡国产算力集群完成全流程训练,彻底摆脱对海外高端算力的依赖,补齐国产大模型自主化的核心短板。

二、三大核心优势

全链路国产算力,数据不出境

从训练芯片到推理引擎全部国产化,数据全程本地运行不上传云端。企业内部源码、项目档案、涉密资料可以放心处理,政企和研发团队的落地门槛大幅降低。

长文本+工程代码能力突出

一次性完整解析整套项目文档、数十份行业报告,代码漏洞排查、批量工程重构、脚本生成准确率大幅优化。针对多步骤智能体任务做了专项调优,长链路工作逻辑连贯性更强。

完全免费开源,部署成本低

模型和推理框架无商用限制,不用持续付云端API费用。配套轻量化压缩方案,中小团队不需要高额算力投入,就能搭建专属私有大模型底座。

三、能用在哪些场景?

企业研发内部知识库:批量解析项目源码、历史方案、行业档案,搭私有问答系统,自动迭代文件、排查代码问题,内部数据本地留存。

海量资料批量复盘分析:一次性读取长篇台账、行业调研资料,自动提取核心数据、生成对比报告,适合大批量档案归档和周期性业务复盘。

开发者低成本二次开发:基于开源底座定制行业专用AI、本地文档处理智能体,不用从零训练大模型,大幅缩短自研周期。

四、怎么上手?

去美团开源仓库、ModelScope或HuggingFace下载完整模型包和推理脚本。在国产算力服务器或高配主机上部署,官方提供了轻量化启动工具。本地离线上传文档和代码直接下发指令,支持百万字批量解析。开发者可以基于源码微调,打造适配自身行业的定制化模型。

五、核心亮点小结

本周最新开源的重磅技术产品,填补了国产万亿大模型自主训练的空白。开源商用无限制,本地私有化部署方案成熟,隐私和合规优势明显。长文本、代码、多步骤任务表现领先。多品牌国产芯片同步适配,硬件选择灵活。

定位精准面向企业级私有化部署,原生交互以开发者工具为主,技术团队可直接调用API或命令行高效集成;普通个人用户可关注社区后续推出的轻量封装版本。

写在最后

最近AI产品大多扎堆做个人办公和轻量化应用,底层自主可控的开源大模型新品确实稀缺。本周开源的美团LongCat-2.0,兼顾国产算力自主、免费商用、离线本地运行三大核心优势。

对于有大批量资料梳理、项目研发、私有数据处理需求的企业和开发者,这款模型有长期实用价值——不用持续订阅云端服务,本地运行也能保障内部资料安全。

你是企业技术负责人还是独立开发者?评论区聊聊,帮你看看LongCat适不适合你的场景。