玩转AI-MiniMax H3开放权重:图片、视频和声音,现在可以一起交给AI

过去做一条AI视频,常常要把图片交给一个工具、声音交给另一个工具,再用剪辑软件把它们拼起来。MiniMax H3想解决的,正是这种“素材各管一段”的麻烦:文字、图片、视频和音频可以作为同一组参考材料,一起参与视频生成。

对普通用户来说,这次更新值得关注的不是又多了一个模型名字,而是做视频的入口正在变得更像一次完整的内容创作。

一、H3已经能用,而且不只停留在发布会里

MiniMax在7月31日发布H3,把它定位为通用多模态视频模型。现在,用户可以从海螺AI的H3官方页面直接进入体验;开发者也可以通过MiniMax开放平台调用模型。与此同时,ComfyUI已经原生支持H3开放权重工作流,可以在本地部署文本生视频、图片生视频和参考素材生视频等流程。

这里要分清两件事:在线平台和API更适合普通用户,操作门槛低;开放权重更适合有显卡、懂模型部署的人。开放权重不等于“任何电脑都能轻松跑”,更不等于生成完全免费。

二、它把四类素材放进了同一个“上下文”

过去给视频模型下指令,最常见的是一段文字,或者一张首帧图片。H3进一步支持把文字、图片、视频和音频放在一起,让模型同时参考人物外观、动作节奏、镜头语言和声音氛围。

比如,你可以提供一张产品图、一段运镜参考和一段背景音乐,再用文字说明“镜头从近景慢慢拉远”。模型面对的不再是一句孤零零的提示词,而是一套更完整的创作条件。

官方资料显示,H3可生成带原生立体声的视频;在线平台和API支持4至15秒、768P或2K输出。这里的“2K”指在线平台或API能力,不应直接套到本地开放权重工作流。ComfyUI官方教程注明,本地原生画布以短边768像素为基准,并有画布上限。

三、普通人最容易上手的,是这三种做法

1. 只写文字:先把想法变成短片

适合没有现成素材、只想快速试创意的人。写清主体、场景、动作、镜头和声音,比堆砌“电影感”“高级感”更有效。

2. 给首尾画面:让变化过程更可控

如果你已经有一张开场图和一张结束图,可以让模型补出中间过程。产品展示、海报动效和简单转场,都可以从这种方式开始。

3. 同时给参考图、视频和音频:让结果更接近你的目标

这是H3最有代表性的用法。参考图负责人物或产品外观,参考视频负责动作和运镜,参考音频负责节奏和声音风格。素材越多不一定越好,关键是每份材料分工明确,彼此不要冲突。

四、“开放权重”让它多了一条本地路线

对于普通读者,开放权重最实用的理解是:除了在网页上点按钮,还可以把模型下载到自己的设备或服务器里,通过ComfyUI等工具搭建工作流。这样更便于批量处理、接入内部流程,也能减少素材在多个在线工具之间来回传递。

但本地运行要付出显卡、存储、部署和维护成本。你还需要自己处理模型文件、工作流节点和参数设置。对只偶尔做几条短视频的人,先用在线入口通常更省事;对需要稳定批量生产、希望掌控工作流的人,本地部署才更有意义。

五、别只看榜单,先看它能不能完成你的任务

官方页面展示了H3在多项视频生成与编辑评测中的表现,但榜单会随样本和新模型更新。对普通用户而言,更有用的判断标准是三个:人物和产品是否保持一致,动作和镜头是否听指令,声音与画面是否真的同步。

第一次尝试时,可以从5秒左右的小任务开始:只放一到两份关键参考,先测试主体和动作,再逐步加入声音、运镜和更多素材。这样更容易判断是哪一项条件影响了结果,也能少花不必要的生成额度。

还要注意,上传他人照片、声音或品牌素材前,应先确认肖像、声音和版权授权。模型能合成,不代表内容就自动具备发布许可。

H3真正有意思的地方,不只是“又能生成更清晰的视频”,而是把图片、视频、声音和文字放进了一次创作里。过去需要在多个工具之间接力的流程,正在被压缩成一个更统一的入口。

如果你只是想让一张照片动起来,在线页面已经足够;如果你要把参考素材、声音和批量流程结合起来,再考虑API或本地开放权重。先从最小任务开始,往往比一次把所有功能都塞进去更容易得到可用结果。

玩转AI——AI也开始开项目组了:腾讯云多 Agent 协同,让“一个助手”变成“一个项目组”

过去用 AI,常常是你把一件事交给一个助手,从头问到尾。现在,腾讯云把“组队干活”搬进了智能体:一个主 Agent 当队长,多个子 Agent 分头研究、互相沟通,再把结果汇总回来。

先把对象说清楚:腾讯云近期介绍的这项能力,不是普通员工直接使用的“智能工作台”,而是腾讯云智能体开发平台 Claw 模式面向需要配置 AI 应用的技术人员或开发者提供的多 Agent 协作能力。

Claw 可以理解为平台里一种能自主规划、调用工具并完成多步骤任务的应用模式。听起来有点技术,换个说法就是:以前你请了一位全能助理;现在,这位助理可以临时拉一个项目群。

一、AI“小组作业”到底怎么分工?

这种“组队”也分两种。

最基础的是“单向委派”。它像项目经理分配:你设置一个主 Agent,再给它配几个角色不同的子 Agent。主 Agent 先理解任务,把工作拆开;子 Agent 各自完成后,把结果交回主 Agent,由它统一整理。组员之间不用互相讨论。

比如你要做一份竞品报告,可以让 3 个子 Agent 分别研究价格、功能和用户评价。它们不用互相聊天,最后把材料交给主 Agent 就行。这种方式适合需要分头推进、但成员之间不必反复沟通的任务。

如果任务更复杂,需要成员互相追问、质疑和接力,就可以在配置应用时进入高级设置,手动打开“允许多 Agent 团队协作”开关。这是应用配置,不是聊天过程中临时打开。

开启后,子 Agent 不只会向主 Agent 汇报,还能直接与其他子 Agent 沟通。官方目前允许一个团队最多包含 1 个主 Agent 和 19 个子 Agent。

但先别急着把 19 个位置都坐满。开了团队协作,也不代表每个任务都会自动组队;系统会根据任务需要决定是否启用。AI 团队和真人团队一样,人多不一定效率高,角色不清反而更容易乱。

二、三个普通人能用上的场景

场景一:做一篇需要核实的内容

假设你要写一篇公众号新闻,可以这样分工:

• 资料 Agent:收集最近 7 天的候选信息,并附上官方来源;

• 核实 Agent:检查日期、产品状态和收费规则;

• 审稿 Agent:专门找夸大、歧义和过时信息;

• 主 Agent:负责写作、取舍和最终确认。

这里有一个关键点:不要让好几个 Agent 同时改同一篇正文。腾讯云官方也提醒,多 Agent 同时编辑同一内容容易产生冲突。更稳妥的做法,是让它们分别提供材料和意见,最后只由一个 Agent 执笔,再由人确认。

场景二:做一次多角度调研

买设备、选供应商、做课程调研时,可以让不同 Agent 各看一个方向:一个查价格,一个查服务,一个找案例,一个专门验证风险。

单个 AI 很容易顺着第一条思路一直说下去。角色分开后,相当于多了几双眼睛,尤其适合互相挑战结论。

场景三:做一个小型应用

再往技术场景走一步,如果你要做网页或内部工具,可以让前端 Agent、后端 Agent、测试 Agent 分工。测试 Agent 发现问题后,可以直接把问题发给对应成员,不必每次都绕回主 Agent。

这类需要交接、反馈和返工的任务,才真正体现“团队协作”的价值。

三、什么时候别开团队协作?

第一,问题很简单时不要开。

查一个概念、改一段话、整理一张表,一个 Agent 就能完成。为了显得高级而组队,往往只会多绕几圈。

第二,流程完全按顺序进行时,不一定要开。

如果第二步必须等第一步结束、第三步又只能等第二步,普通工作流可能更清楚。

第三,要留意成本。

腾讯云官方提示,开启团队协作后,Token 消耗大约是单向委派的 2—3 倍。Token 可以简单理解为 AI 处理信息的计量单位,参与的角色越多、沟通越频繁,通常就会消耗更多。

从 7 月 1 日起,智能工作台和 Claw 模式应用运行任务均已结束限时免费公测,转为按运行时长计费;模型、工具和 Skills 还会消耗 PU。PU 是平台的通用计费单位,官方当前换算为 1 PU=0.001 元。实际价格可能调整,正式使用前应以计费页面为准,并先用小任务测试效果和费用。

怎么选,可以记住三句话:

简单问答,用单 Agent。

需要分头查资料,用单向委派。

需要互相追问、接力和返工,再开团队协作。

多 Agent 最值得关注的,不是“同时叫来更多 AI”,而是把过去藏在一个对话框里的工作过程,变成可以分工、交接和检查的流程。

它不会自动让结果变好。真正决定质量的,仍然是角色有没有分清、资料来源靠不靠谱,以及最后有没有一个人负责拍板。

如果让你组一支 AI 小队,你最先会设置哪三个角色?欢迎在评论区告诉我。

玩转AI——Kimi K3来了:这次不只陪你聊天,而是想接住一整套项目

2.8万亿参数、原生视觉、最高100万Token上下文——Kimi K3的数字很醒目,但普通用户真正需要关注的,是它能否读完一整套资料,并把调研、分析、文档和编程等长任务持续做下去。

前几期我们聊过桌面智能体、零代码应用,也聊过能围绕资料做研究的AI工具。本期轮到国产大模型里的“长文本老选手”Kimi。

7月16日,月之暗面发布新一代旗舰模型Kimi K3。官方公布的几个数字很抢眼:2.8万亿参数、原生视觉能力、最高100万Token上下文,并重点面向长程编程、知识工作和复杂Agent任务。

一、Kimi K3升级的重点是什么?

先说结论:K3的重点不是让简单聊天变得更花哨,而是提高处理“重任务”的能力。

过去用AI做复杂项目,经常遇到三个问题:资料一次放不全、对话长了忘记前文、任务步骤一多就开始跑偏。

K3把上下文上限提高到100万Token,适合处理大型代码库、成套项目文档和多份研究资料。这里要注意,100万Token是模型支持的上限;网页端需要相应的高等级会员权益,并不是所有账号默认开放。

它还原生支持图片理解。除了文字、表格和文档,你也可以把截图、图表、流程图一起交给它,让模型结合图文分析,而不是只读其中的文字。以前分析竞品页面,需要先用文字描述页面结构;现在可以直接把网页截图交给K3,让它结合页面布局、图表和文字一起分析。

至于KDA、Attention Residuals和MoE这些技术名词,普通用户不用背。它们最终想解决的都是同一件事:资料更多、任务更长时,模型仍能尽量保持思路连贯。

二、普通人可以用它做什么?

1. 给一整套项目资料做复盘

把几个月的周报、会议纪要、方案和数据表放进去,让它按“目标—进展—问题—下一步”整理,并找出前后矛盾和长期没有解决的事项。

以前我们需要在十几个文件之间来回翻,现在可以先让AI完成第一轮梳理,再由人核对关键结论。

2. 横向比较多份报告

一次上传多份行业报告时,不要只说“帮我总结”。可以直接要求:

比较这些报告的共同判断、主要分歧和数据口径;每条结论标出来源;最后给出三条可执行建议。不确定的信息单独列出,不要自行补全。

这样得到的结果,更接近一份可以继续加工的调研底稿。

以前同时看几份报告,最费时间的往往不是阅读,而是核对同一指标是否采用同一口径;先让AI把差异列出来,人再回到原文确认,可以省掉大量来回翻找的时间。

3. 从资料直接做到成品

K3不仅能输出文字,还可以参与生成文档、表格、PPT和网站等可编辑成果。

例如,你可以让它先读取会议材料,再整理汇报逻辑、制作演示文稿提纲,最后检查遗漏。这种工作方式更接近“把整个任务交给AI”。

以前最容易卡在“内容已经有了,但还要重新整理成不同格式”;现在可以让AI沿着同一套材料继续往下做,减少在文档、表格和PPT之间反复复制粘贴。

4. 处理周期更长的编程任务

对开发者来说,K3更明显的优势是读取大型代码库,并持续完成修改、测试和排错。

普通用户即使不写代码,也可以关注这一点。因为模型能否长期稳定执行编程任务,也会影响它完成多步骤办公任务时的可靠性。

过去处理长任务时,模型常常做到一半就忘了前面的约束,还需要人工反复提醒;K3想提升的,正是这类持续执行能力。

三、怎么开始使用?

第一步,打开Kimi网页端或最新版客户端,在输入框右下方的模型选择器中切换到K3。K3也已经应用在Kimi Work、Kimi Code和官方API中。

第二步,把任务背景、参考资料和交付格式一次说清楚。比如:

阅读我上传的12份周报和3份会议纪要,先整理本季度项目时间线,再找出延期事项及原因,最后生成一份10页以内的复盘PPT提纲。所有结论都标出来自哪个文件,不确定的地方单独列出。

第三步,不要拿到第一版就结束。继续让它检查遗漏、核对引用、压缩篇幅,或者把内容改成适合汇报、公众号和内部通知的不同版本。

记住一个实用公式:

复杂任务 = 输入材料 + 处理步骤 + 输出格式 + 核查要求。

这四项说得越清楚,AI越不容易跑偏。

四、K3、K2.6和K3集群怎么选?

如果只是问一个简单问题、查资料或改一句文案,响应更快的K2.6通常已经够用。Kimi帮助中心显示,K2.6在聊天场景中不消耗会员额度。

需要处理成套资料、复杂推理、可编辑文档或多步骤任务时,可以切换到K3,但会消耗相应额度。

如果任务涉及大规模搜索、批量处理或很长的内容,可以考虑K3集群。它更像“同时安排多名助手分头工作”,但同样会消耗额度。

五、使用前还要注意什么?

上下文更长,不代表结论一定正确。资料越多,越要要求AI标注来源,并对关键数字回到原文复核。

也不要随意上传合同原件、身份证件、未公开经营数据和公司源码。涉及内部材料时,要先确认单位的数据安全要求和账号权限。

需要说明的是,“开放模型”不等于普通电脑就能轻松本地运行。K3总参数规模达到2.8万亿,官方建议使用由64张以上加速卡组成的超节点配置进行部署。对大多数普通用户来说,更现实的方式仍然是通过Kimi网页端、App、Kimi Work或API直接使用。

写在最后

Kimi K3最值得关注的,不是2.8万亿这个数字本身,而是AI正在从“回答一个问题”,走向“接住一整套项目”。

对普通职场人来说,它未必适合每一次简单对话,却很适合那些资料多、周期长、需要反复核查的重任务。

与其拿它问天气、改句子,不如把积压很久的项目资料交给它,看看它能不能先替你完成第一轮整理。

你最想让Kimi K3接手哪一项重活?欢迎在评论区留言,我可以帮你把第一条指令写好。

探新AI-知识库越用越乱?HyperGraph说:让文档自己“拉帮结派”

企业做 AI 知识库,常常遇到一种尴尬:上万份合同、规范、报告整整齐齐码在系统里,看着挺全,真到用的时候 —— 想找跟某个项目相关的所有资料,搜出来一堆碎片,东一榔头西一棒子,拼都拼不起来。

有没有一种可能:知识库自己管理自己?

现在的知识库,为什么越用越鸡肋?

市面上的主流工具,路子就两条,各有各的坑。

一条是向量检索。把每份文档切成小段,做语义匹配。优点是省事,缺点是文件之间完全不连通。同一个客户出现在合同 A 和报告 B 里,系统根本不认识,跨文件查资料全靠人工手动翻找。

另一条是固定图谱。实体、关系都靠人一笔一笔标进去,精度高,但维护成本更高。业务迭代快的团队,每周都要花大量人力去补节点、建新边,一不留神就滞后。知识断层一旦出现,AI 给出来的东西就少胳膊少腿。

说白了,两类工具都缺一个能力 —— 自己长大、自己更新的能力。 知识库建完的那天,就是它开始变旧的那天。

玩转AI——Gemini Notebook是我工作里最常用的AI之一,尤其是做PPT的时候

你以为它只是笔记本,其实能读资料、跑数据——Gemini Notebook来了

Google出品,把PDF、网页、表格和视频丢进去,不仅能读,还能总结、对比、画图、出成品

7月16日,Google正式把NotebookLM更名为Gemini Notebook。

名字像是换了块门牌,真正的升级却在后厨:部分付费用户已经能让它在安全云端环境中运行代码,资料分析从“帮你看懂”进化到“帮你算完”。

之前我们聊过桌面智能体、聊过文件生成工具,各有各的擅长。但Gemini Notebook切入的是另一个场景——你不是要它凭空编东西,而是要它先把你喂的材料吃透,再替你干活。

一句话概括新能力:把PDF、网页、表格和视频丢进去,Gemini Notebook不只帮你读,还能围绕原始资料做总结、对比、画图表、导出成品文件。

一、怎么用

第一步,建一本笔记。登录Gemini Notebook,新建项目,把PDF、Word、PPT、CSV、网页链接、YouTube视频或录音一次性丢进去。每个项目独立管理,资料不会在不同笔记之间乱串。

第二步,直接说人话。 别只问“总结一下”,试试这样下任务:“对比三份报告的共同结论和冲突点,每条都标出来源”“把这张CSV按月份分析,找出异常波动并解释原因”。回答会附资料引用,方便你回到原文核对。

第三步,到Studio里收成品。 你可以生成简报、思维导图、测验、音频解读、数据表或演示文稿。已开放云端计算能力的账号,还能让它运行代码、画图表、导出Excel、PPT、Word等文件。

 二、场景示例

备课做课件:上传教材、政策文件和几篇论文,让它先列知识框架,再生成课堂提问、随堂测验和讲解提纲。以前资料在文件夹里“各过各的”,现在终于肯坐下来开会了。

项目复盘:放入周报、会议纪要和数据表,要求它找出目标偏差、关键原因和下周行动。数据多时,再让它画趋势图,省掉手动筛表和拼结论。

快速吃透新领域:把行业报告、公开课视频和访谈录音放进一本笔记,先听音频概览,再沿着引用追问。适合调研、考试复习,也适合临时接到一个完全陌生的项目。

三、注意事项

改名不等于所有新功能同时到账。云端运行代码目前优先面向Google AI Ultra和部分Workspace商业用户,未来几周逐步覆盖Pro网页用户。普通用户仍可使用资料上传、基于来源问答和Studio内容生成功能。

AI回答有引用也不代表绝对正确,正式材料仍要回原文复核。上传内部资料前,确认好账号权限和分享范围。

最后聊两句

市面上AI工具分两类:一类帮你“凭空造”,一类帮你“从材料里挖”。Gemini Notebook稳稳站在后者。

它不是让你跟AI闲聊,而是让你把资料扔进去、下命令、然后拿走成果。之前我们聊的桌面智能体是帮你操控电脑完成多步骤操作;腾讯元宝是一句话生成PPT和表格;百度秒哒是零代码搭应用。Gemini Notebook做的事不一样——它解决的是“围绕一堆资料深挖、追问、出成果”这件事。

改名只是开始。Gemini Notebook最值得关注的,是“资料库”开始长出真正的执行能力——从“读懂”到“算完”,Google把它塞进了一本笔记本里。**你最想把哪一堆资料塞进Gemini Notebook?评论区聊聊,我帮你把第一条指令写好。

探新AI-DRIFT 把 “读” 和 “想” 拆成了两条路,就让长文档推理速度翻了倍

大模型处理长文档为什么总是慢半拍?根源不在模型本身,在它的 “阅读方式”。

现行主流方案,无论开源还是商用,面对几十页合同、三五份行业报告,全部是同一套流程:原始素材一次性灌入,同一个模型既当信息筛选员,又当逻辑推演师。两类任务算力需求天差地别,却挤在同一条管道里跑。大量资源消耗在过滤无关段落上,真正留给深度推理的算力所剩无几。

行业里各种优化手段都试过了,但没一个真正触达病灶:

  • 层级分流早退:只在模型内部省几层计算,读和想依然绑在一起;
  • 生成提速调度:只管输出快慢,前置冗余素材一点没少;
  • 蒸馏和参数适配:动的是训练阶段,推理流程照旧;
  • 事实校验工具:在本就不够快的流程上再叠一轮检查,长文本场景雪上加霜。

所有方案都绕开了最核心的矛盾:“信息读取” 和 “逻辑推演” 压根不应该由同一套网络同时承担。

DRIFT来解决核心思路:先摘菜,再炒菜

DRIFT 框架不碰模型本身,不调权重、不改结构、不依赖专用硬件,仅依靠三层调度代码,将推理流程底层拆为两条独立链路,搭配异步调度器并行作业。

轻量化萃取单元(专职摘菜)

仅负责从原始文档提取有效信息:关键实体、关联关系、有效条件,过滤废话、重复、无关内容;不做任何逻辑推导,算力消耗极低,支持几十份文档并行提纯。

主逻辑推演单元(专心炒菜)

不再直面杂乱原始文本,仅接收萃取完成的结构化知识片段;全部算力集中用于因果推导、条件关联、方案整合,消除杂质干扰,推理连贯性大幅提升。

异步调度器(双链路协同)

萃取单元持续处理新素材,推演单元收到有效片段即可分段计算,彻底消除传统模式 “全文读完才能思考” 的长时间阻塞。全程属于外置推理优化,无需词元改造、多模态适配、训练调整,与市面上绝大多数软件优化方案无技术重叠。

我们来看看实测数据

先说万词级多文档分析。团队直接扔进去20多份行业研报,加起来快三万字。以前这种量级,模型读到一半就开始“失忆”,前后逻辑接不上,推理延迟动不动就奔着分钟级去。套上DRIFT之后,萃取单元先把每份报告的核心观点、关键数据、关联关系摘出来,主模型只负责在干净知识片段上做推演。总耗时压了将近一半。

来看合同审查。拿八百多份真实商业合同做批量抽检,里面大量条款是模板化套话、免责声明、格式描述,真正需要人工级推演的风险条款占比不到四成。萃取单元直接把六成以上的废话段落原地过滤掉,主模型面对的全是有效条款,逻辑推演那块儿的时间直接砍半。

本地部署这是最让人意外的。实验室专门拿了台老旧的办公电脑做测试,没显卡,只有普通CPU。以前这种设备打开一个几百页的PDF都费劲,更别说跑推理了。装上Mini-DRIFT之后,萃取单元在CPU上跑得稳稳的,读一份上千页的工程档案,翻页、摘录、提取关键关系全程没有明显卡顿。全程没碰任何专用硬件,纯靠流程拆分就把事情办了。

三个场景跑下来,结论很一致:让模型读得更少,想得更深。DRIFT不挑算力、不挑设备,只干一件事——让模型不再傻读全文,而是摘干净了再想。效果嘛,上面这几组数摆在这儿,比什么宣传都实在。

玩转AI-本周重磅开源!美团LongCat-2.0来了,万亿参数+国产算力自主训练

美团出品,1.6万亿参数MoE架构,MIT协议免费商用,纯国产算力训练

往期我们聊的Coze 3.0、百度秒哒,都是面向普通用户的上层应用工具。本周换个视角——AI行业迎来一个底层技术里程碑事件。

7月6日,美团LongCat-2.0正式开源,国内首款全程依托国产算力集群完成训练、推理的万亿参数混合专家大模型。对企业私有化部署、开发者二次开发具备极高价值。

一、LongCat-2.0是什么?

总参数1.6万亿,MoE混合专家架构,单Token动态激活480亿参数,原生支持百万字超长上下文读取。

6月底完成技术发布,本周正式开放完整权重、推理代码、微调工具。采用MIT开源协议,不限企业商用。华为昇腾、摩尔线程、沐曦等国产芯片同步完成适配,普通高配服务器也能本地离线部署。

最大亮点:依托五万卡国产算力集群完成全流程训练,彻底摆脱对海外高端算力的依赖,补齐国产大模型自主化的核心短板。

二、三大核心优势

全链路国产算力,数据不出境

从训练芯片到推理引擎全部国产化,数据全程本地运行不上传云端。企业内部源码、项目档案、涉密资料可以放心处理,政企和研发团队的落地门槛大幅降低。

长文本+工程代码能力突出

一次性完整解析整套项目文档、数十份行业报告,代码漏洞排查、批量工程重构、脚本生成准确率大幅优化。针对多步骤智能体任务做了专项调优,长链路工作逻辑连贯性更强。

完全免费开源,部署成本低

模型和推理框架无商用限制,不用持续付云端API费用。配套轻量化压缩方案,中小团队不需要高额算力投入,就能搭建专属私有大模型底座。

三、能用在哪些场景?

企业研发内部知识库:批量解析项目源码、历史方案、行业档案,搭私有问答系统,自动迭代文件、排查代码问题,内部数据本地留存。

海量资料批量复盘分析:一次性读取长篇台账、行业调研资料,自动提取核心数据、生成对比报告,适合大批量档案归档和周期性业务复盘。

开发者低成本二次开发:基于开源底座定制行业专用AI、本地文档处理智能体,不用从零训练大模型,大幅缩短自研周期。

四、怎么上手?

去美团开源仓库、ModelScope或HuggingFace下载完整模型包和推理脚本。在国产算力服务器或高配主机上部署,官方提供了轻量化启动工具。本地离线上传文档和代码直接下发指令,支持百万字批量解析。开发者可以基于源码微调,打造适配自身行业的定制化模型。

五、核心亮点小结

本周最新开源的重磅技术产品,填补了国产万亿大模型自主训练的空白。开源商用无限制,本地私有化部署方案成熟,隐私和合规优势明显。长文本、代码、多步骤任务表现领先。多品牌国产芯片同步适配,硬件选择灵活。

定位精准面向企业级私有化部署,原生交互以开发者工具为主,技术团队可直接调用API或命令行高效集成;普通个人用户可关注社区后续推出的轻量封装版本。

写在最后

最近AI产品大多扎堆做个人办公和轻量化应用,底层自主可控的开源大模型新品确实稀缺。本周开源的美团LongCat-2.0,兼顾国产算力自主、免费商用、离线本地运行三大核心优势。

对于有大批量资料梳理、项目研发、私有数据处理需求的企业和开发者,这款模型有长期实用价值——不用持续订阅云端服务,本地运行也能保障内部资料安全。

你是企业技术负责人还是独立开发者?评论区聊聊,帮你看看LongCat适不适合你的场景。

探新AI-大模型从“文盲”到“学霸”的成长之路

手机里那个能写诗、能编程、能陪你聊天的 AI,三个月前还在 “牙牙学语”,连一句完整的话都说不利索。它是怎么在这么短的时间里,从 “文盲” 变成 “学霸” 的?答案藏在一条漫长而昂贵的技术流水线上。今天我们就拆开这台 “智能引擎”,看看它到底是怎么被一步步训练出来的。

预训练:让模型先 “识字”

大模型的起点,是一个对语言毫无概念的神经网络 —— 几万亿个参数随机初始化,相当于一张白纸,连 “苹果” 是什么都不知道。

训练的第一步,叫预训练。研究人员从互联网上抓取海量文本 ——Common Crawl 积累了超过十年的网页快照,加上维基百科、书籍、学术论文、GitHub 代码库,总量可达数万亿 Token。

预训练的核心任务,是让模型学会预测下一个 Token。 这个任务在技术上叫作 “自回归语言建模”,训练过程中,模型每次 “看到” 一段文本,会被要求遮住最后一个词,用自己的参数去猜。猜对了,参数微调加强;猜错了,反向传播调整权重。通过数万亿次这样的迭代,模型内部的参数逐渐学会了捕捉词汇之间的共现关系、语法结构,甚至一些隐性的推理模式。

这个阶段的 “教材” 是未经筛选的互联网文本,质量参差不齐 —— 包含错误信息、偏见表述、低质内容。模型像海绵一样 “照单全收”,这为日后的 AI 幻觉埋下了伏笔。预训练的核心目标是 “语言能力” 而非 “事实准确性”。 模型在这个阶段学会了 “如何像人一样说话”,但它并不 “知道” 自己说的是真是假。

监督微调:教会模型 “好好回答问题”

预训练结束后,模型是一个 “语言流利但不太听话” 的通才。它擅长文本续写,但不擅长按照人类的指令回答问题。

这时候需要第二步:监督微调(Supervised Fine-Tuning, SFT)。

SFT 的核心思路是:给模型看一批 “标准答案” 示例,让它模仿这些示例来回答问题。这些示例由人类标注员精心编写,格式通常是 “用户问题 — 标准回答” 的配对。

示例:
用户问:“什么是光合作用?”
标准回答:“光合作用是植物利用光能将二氧化碳和水转化为有机物和氧气的过程……”

模型在数万条这样的示例上做有监督学习,逐步调整参数,学会 “当用户这样问时,我应该给出这样的回答”。这个阶段相当于 “模仿学习”—— 模型模仿人类标注员的回答风格和内容结构,把模型从 “文本续写器” 变成了 “问答助理”。

经过 SFT,模型的回答变得结构清晰、格式规范,但它仍然可能输出有害内容、编造事实,或者在不该回答的时候过度 “配合”。比如问它 “如何制作危险物品”,它可能真的给出步骤 —— 因为它只是学会了 “回答问题”,还没学会 “判断什么不该回答”。于是需要第三步。

基于人类反馈的强化学习:对齐人类偏好

如果说 SFT 是让模型 “学会答题”,那么基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF)就是让模型 “学会做人”—— 理解什么回答是好的、什么是不好的,形成价值判断。

RLHF 不是 “教” 模型新知识,而是调整它的 “输出偏好”。 它改变的不是模型 “能生成什么”,而是模型 “倾向于生成什么”。打个比方:SFT 像是给模型一本 “答题范本” 让它照着抄,RLHF 则是通过奖励和惩罚,让模型自己摸索出 “怎么做才更讨人喜欢”。

这三步组合起来,构成当前全球主流大模型训练的标准范式。

现在我们回过头来看,那个每天陪你聊天、帮你写周报的AI,到底是个什么样的存在?

它不是“凭空蹦出来的智慧”,也不是什么神秘的“电子幽灵”。它的真身,是一串串在GPU里疯狂奔跑的电流,是2.5万张显卡连起来能绕足球场一圈的钢铁矩阵,是三个月日夜不停的轰鸣风扇,是烧掉的上亿美元电费账单。

当然,也别太神话它。 它再厉害,也只是个“高级概率预测器”。它会编瞎话,会犯低级错误,会在你问“1+1等于几”的时候一本正经地跟你辩论“也可以是3”。

玩转AI——7月重磅!腾讯混元Hy3上线,元宝免费帮你做PPT、Excel、PDF

腾讯出品,295B参数新模型,文件生成功能个人永久免费

往期我们聊过团队协同的Coze 3.0、零代码搭应用的百度秒哒,都是各自赛道的实用选手。本周迎来7月首个重磅大模型更新——腾讯混元Hy3正式发布,同步打通元宝全端产品,免费开放Agent任务能力。

一句话概括这次更新的核心价值:不用切换多款工具,一句话自动生成PPT、Excel、PDF等完整办公文件,全程免费。

一、混元Hy3是什么?

7月6日,腾讯正式发布新一代混合专家大模型混元Hy3,295B总参数、21B动态激活参数,靠快慢双思考架构大幅降低模型幻觉、提升多步骤任务稳定性。

对比前代,常识错误率减半,文本幻觉率下降超50%,工具调用和长链路任务规划能力跨越式升级。

发布当天,腾讯元宝全端同步接入Hy3底座,上线全新免费Agent功能——不用额外开通权限,切换模型就能直接用。

二、两大核心亮点

文件一站式交付,全流程自动闭环

普通AI只输出文字,Hy3驱动下的元宝Agent能自主拆解需求,自动完成素材搜集、数据整理、排版制作,直接交付可下载的成品文件。

日常办公一句指令搞定整套活:制作市场分析PPT、输出数据统计Excel、生成旅行攻略PDF、搭建互动教学HTML页面。不用手动复制粘贴、不用二次排版,多轮对话还能反复调整版式和内容。

免费+轻量,上手零门槛

不用下载独立客户端、不用搭建工作流、不用调提示词。打开腾讯元宝,切换「Hy3深度思考」模式就能触发任务智能体,全部文件生成功能个人永久免费

API同步降价,输入Token低至1元/百万,中小企业批量接入成本也很低。

三、能帮你干哪些活?

职场办公:自动生成工作汇报PPT、数据复盘表格、项目方案Word文档,省去排版制图汇总的大量时间。

内容创作与规划:撰写完整调研报告、一键生成多日出行攻略PDF,自动整合路线预算景点信息。教学素材:快速搭课堂互动小游戏、知识点自测工具、习题汇总文档,几分钟成型。

四、怎么用?

打开腾讯元宝APP或网页端,更新到最新版本。模型选择栏切到「Hy3深度思考」模式,直接完整描述需求、注明要什么格式——比如“帮我做一份Q2市场分析PPT,10页左右”——AI自动执行全流程任务。生成完一键下载,不满意就继续对话调整。

五、亮点小结

本周最新上线的模型能力,轻量化办公智能体免费开放,无额外付费门槛。幻觉控制和多步骤任务稳定性大幅优化,成品文件完整度高。依托元宝原生客户端,无需额外软件,手机电脑随时随地可用。API低价开放,企业和个人开发者都能低成本接入。

写在最后

近期AI赛道不少产品扎堆卷电脑自动操控,上手门槛偏高,普通用户用不太上。而腾讯混元Hy3+元宝Agent的组合,精准瞄准大众高频办公需求——把完整文件生成能力免费下放,不用复杂配置,不用额外软件,一句话产出可直接用的成品资料。

经常写汇报、做表格、整理方案的,可以直接打开元宝免费体验,省下大把重复性文书时间。

你最想让元宝帮你生成什么文件?评论区聊聊,我帮你试试能不能做。

玩转AI——微信和支付宝同时“长”出AI了,这次不用下载新APP

微信小微、支付宝阿宝双双开启内测,零下载零注册,即用即走

前几期我们聊的都是桌面端智能体、独立AI应用,多少都要走一遍“下载→安装→注册→登录”的流程。本期换个视角——你每天已经打开的APP里,自己长出AI了。

6月中下旬,微信「小微」和支付宝「阿宝」先后启动内测。两款产品逻辑一致:不新增APP,不重新注册,原生嵌入,随手唤起。下面直接讲清楚它们是什么、能干什么、怎么用。

一、先认识一下这两位“原住民”

微信·小微(6月20日小范围灰度内测)

基于微信自研WeLM大模型,无需下载新程序,更新微信最新版本后,有内测资格的用户点击首页左上角图标或右滑即可唤起。深度打通聊天、文件、收藏、公众号、小程序整套微信生态——能看群聊、能读文件、能调小程序,主打社交办公一体化。

支付宝·阿宝(6月16日邀请制内测)

支付宝史上最大交互改版,右滑切换AI专属界面,重构了原本繁杂的菜单栏逻辑。依托支付、理财、生活服务底层体系,聚焦收支管理、便民办事、生活规划——查账单、缴水电、找充电桩,一句话直达。

二、它们比独立AI工具强在哪?

零下载零注册,即用即走

不用反复安装、登录多款AI软件,随手唤起处理临时事务,操作链路大幅缩短。

深度打通原生生态,数据流转更顺畅

小微可以直接读群聊内容、总结长文档、梳理收藏文章、一键调起小程序;阿宝能自动解析个人账单、归集资产明细、直达政务生活服务。不用手动上传文件,效率碾压外部通用AI。

隐私权限可控,敏感信息不上传

聊天记录、收支流水均设独立授权开关,你可以自主决定AI读取范围。转账、付款等资金操作必须本人二次确认,杜绝风险。

不用学提示词,说人话就行

不要求用户学什么提示词工程、搭建工作流,口语化下指令就能完成操作。普通用户上手几乎没有门槛。

三、能帮你干哪些活?

办公协同:自动整理群聊会议纪要、提炼通知重点、改写正式文案

资料处理:总结公众号长文、解读转发来的PDF、检索历史聊天文件

社交辅助:写朋友圈文案、定制节日问候、优化沟通话术

便捷办事:一句话打车、点餐、挂号,自动跳转小程序完成预约

支付宝·阿宝的擅长场景

收支统筹:月度开销分类统计、生成消费分析报告、梳理还款定投计划

便民业务:一键查社保公积金、缴水电费、预约寄件、找充电桩

理财科普:通俗解读理财产品、梳理资产配置思路、解答基础理财疑问

账单管理:快速筛选历史收支、对账整理、开具电子凭证

四、怎么用上它们?

微信小微:升级微信到最新版本,有内测资格的直接滑动或点击图标唤醒,按需开启数据读取权限即可对话使用。暂时没入口的,等后续分批推送。

支付宝阿宝:更新支付宝新版,输入官方邀请码获取内测资格,右滑切换AI界面,按需开放账单和定位权限后下发指令。资金操作全程需本人确认。

两款助手都可以随时关闭授权、清空对话记录,隐私边界你自己说了算。

五、核心亮点

赛道新颖,避开桌面智能体的同质化内卷,内嵌原生AI是目前行业最新方向。依托十亿级用户APP,普及潜力大,轻量化高频体验流畅。深度匹配社交、支付独有场景,实用性强于通用AI。大厂原生安全体系完善,敏感数据权限可控。

前一阵AI产品扎堆卷客户端自动化、电脑操控能力,同质化越来越明显。而微信小微和支付宝阿宝的内测,标志着一个新拐点:AI不再是需要主动下载的独立工具,而是嵌入日常高频软件、随取随用的基础能力。

对于绝大多数普通用户来说,不必堆砌各种

AI软件。每天必开的微信和支付宝里,已经能搞定文案整理、资料归纳、收支规划、便民办事这些高频琐事。随着内测范围持续放开,内嵌式AI很可能成为最普及的AI使用形态。

你拿到小微或阿宝的内测资格了吗?评论区聊聊体验。