MoreRSS

site iconMeituan Tech | 美团技术团队修改

美团技术团队的博客
请复制 RSS 到你的阅读器,或快速订阅到 :

Inoreader Feedly Follow Feedbin Local Reader

Meituan Tech | 美团技术团队的 RSS 预览

美团正式发布 CatPaw:全场景 AI Agent,从个人提效到企业智能化

本月,美团 LongCat 2.0 已正式开源,总参数 1.6T,平均激活约 48B,动态范围 33B 到 56B,原生支持 1M 超长上下文。这是首个在五万张国产算力卡上完成全流程训练与推理的万亿参数模型。开源只是第一步,让 LongCat 2.0 在真实的工作任务中成为可靠的“工作伙伴”,才是真正的考验。

现在,搭载 LongCat 2.0 的美团全场景 AI Agent 平台 CatPaw 正式上线,将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。

不仅如此,依托美团十余年深耕本地生活的行业积累,CatPaw 将商家经营、服务履约与消费决策的深度认知融入其中,助力企业构建 AI 数字员工、推进业务智能化升级。

目前,CatPaw 已在美团内部大规模落地:累计覆盖 9 万员工、搭建 Agent 3 万个,并在多个真实业务场景中完成验证。

全时段运行,多终端协作的 AI 智能工作台

01 移动/PC/云端,全时段多端协作

提供独立的移动端 App 与 PC 客户端,双端任务实时同步、无缝协作。移动端支持随时发起任务、查看进度与远程确认关键决策;PC 端专注本地深度执行,具备文件操作、浏览器控制与终端命令等完整能力。

云端模式支持 7 × 24 小时不间断运行,即使本地设备关机或断网也不受影响。长程任务与定时任务于云端持续运转,完成后随时打开手机或电脑即可查看成果。

02 深耕本地生活,融合美团业务生态

在全场景通用 AI Agent 能力的基础上,CatPaw 进一步融入了美团在本地生活领域的全链路行业认知。从门店经营、评价体系、营销转化到履约配送,这些深度积累已被封装为即装即用的专家与技能,覆盖门店评价诊断与优化、商品文案生成、营销物料设计评估、活动策划、经营数据分析等场景。

CatPaw 既是人人可用的全能 AI 助手,也是真正懂本地生活生意的智能搭档。

03 专家与技能,丰富能力即装即用

CatPaw 支持 AI 专家,每位专家集成多项技能与子代理,高效完成特定领域的复杂任务。从专家广场一键安装即可使用,也可通过对话将自己的工作方式快速封装为专属专家,团队共享复用。

平台内置丰富的技能库,开箱即用。内嵌浏览器还支持操作过程一键录制,将日常高频流程自动生成专属技能,让个人与团队经验沉淀为可复用的数字化资产。

支持跨会话长期记忆,自动记忆用户的个性化偏好、操作习惯与历史上下文,跨设备、跨对话保持连续理解,越用越懂你。

04 对话即交付,多 Agent 自主协同

只需明确最终目标,Agent 便会自主规划步骤并在授权范围内深度执行:读取文件、操作浏览器、运行终端命令,直接交付 Excel、可视化报告或代码等可用成果。

面对跨领域的复杂任务,系统动态进行任务拆解,调度多个具备专属工具的 Agent 并发处理,各 Agent 在独立环境中互不干扰,进度实时可见,结果自动汇总。

从 AI 工作台到业务系统:Managed Agents

CatPaw Managed Agents 是企业级 AI Agent 开发与托管平台,提供开箱即用的工程底座,无需从零搭建底层基建,即可快速构建、部署与管理专属 Agent。

01 数字员工,扫码即用灵活配置

数字员工是运行在飞书、企微等 IM 中的 AI 虚拟同事,@ 即可唤醒使用。平台预置多种角色模板,扫码即用;美团在本地生活领域的长期积累也已沉淀为专属模板,不只是通用的聊天机器人,而是理解业务的行业 AI 助手。

同时支持通过 AI 对话描述需求,快速生成专属数字员工。从 Agent 创建到环境部署、会话初始化,全程自动完成,无需手动配置

提示词、知识库、凭证、工具均支持在线管理,团队可按业务场景灵活搭建。

02 企业级安全,数据隔离可控

Agent 运行环境严格隔离,租户间数据互不可见。凭证集中托管,确保 Agent 全程零接触敏感资产

支持分级权限管控与私有化部署,全面满足企业合规与安全审计要求。

03 Agent 托管运行,持续在线

支持按需配置运行环境,一键托管上线,资源动态扩缩

沙箱环境轻量隔离,百毫秒级冷启动,闲时自动释放,兼顾响应速度与成本。

04 可视化运维,全链路可观测

提供统一的运维管理界面,会话记录完整留存可追溯,支持在线调试实时排查问题,模型调用量与消耗清晰可见

多维度数据统计与分析,帮助团队持续评估 Agent 表现、优化运行效果。

从个人提效到组织智能化:与商家一起探索更多可能

在全场景 AI 能力之上,CatPaw 提供组织级的管理与管控能力,满足商家**规模化落地 AI **的管理需求。

CatPaw 提供统一管理后台,支持团队账号体系。团队成员与权限集中管理,用量明细与消耗实时可查,成本清晰可控。AI 专家和技能支持按团队或角色集中配置与精准下发,一线员工开箱即用,AI 能力快速转化为实际生产力。

此外,CatPaw 还提供与美团业态深度关联的专属专家与技能,覆盖外卖、服务零售、医药健康等多个行业。以服务零售为例,美团商家运营专家整合了经营数据分析、评价管理、门店装修等核心场景,帮助商家实现智能化运营。

CatPaw 将持续深入行业场景,让 AI Agent 真正成为驱动经营增长的数字化伙伴。更多能力陆续开放中,诚邀美团合作商家抢先体验

体验地址https://catpaw.meituan.com/

下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知

过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。

图1:BrowseComp 准确率进展曲线

BrowseComp 的题目由人工设计,局限在于只能基于标注者已知的实体和关系构思,无法站在全局知识网络视角判断:哪些条件真的难检索?哪些约束的候选空间足够大?正是这种局限,让我们开始思考另一种可能性:能不能让机器自己来出题?

美团 LongCat 团队在最新论文中提出的 LoHoSearch 基准,就是把这种可能性变成了现实。

LoHoSearch 的核心"硬核"看点

  • 知识图谱自动化构造。 以覆盖762万维基百科实体的知识图谱为基础自动生成题目,替代人工出题。基准含544道经人工核验的题目,覆盖11个领域。
  • 双维度难度控制。 在生成中系统控制搜索空间与结构复杂度。构建出难度显著高于现有基准的挑战性问题。
  • 当前模型性能表现。 已评测模型中,GPT-5.5准确率为34.74%;现有上下文管理策略在LoHoSearch上提升幅度为6.8%,低于在BrowseComp上的14.03%。

01 设计原理:让机器出题,需要几部?

机器出题的前提,是让机器拥有全局视野。整个构建流程可以分为四个环节:建图 → 控制难度 → 质量把关 → 数据概览。下面逐一展开。

1.1 建图:搭建知识图谱,让机器获得全局视野

LoHoSearch 的第一步,是从完整的英文维基百科出发搭建一张大规模知识图谱:

  • 762 万个实体(每个维基页面是一个实体节点)
  • 2.65 亿条有向边(页面正文中指向其他维基页面的超链接)
  • 每个实体的类型取自其 Wikidata P31 类别,实体热度用入度来衡量

这张图谱为后续在全局视角下挑选"难题"提供了基础。

图2:LoHoSearch 数据构造流程总览(知识图谱构建 → 子图采样 → QA 生成与验证 → 后置过滤与人工复核)

有了图谱之后,下一个问题是:什么样的题目才算"难"?LoHoSearch 从两个维度来定义难度。

1.2 控制难度:搜索空间和结构复杂度两个维度

决定搜索难度的核心有两个维度,而它们恰恰是人工出题最难把控的:

  • 搜索空间:满足一个条件的候选实体有多少。候选越多,排除成本越高。
  • 结构复杂度:要同时满足多少条件才能锁定答案。条件越多、咬合越紧,求解链条越长。

针对这两个维度,LoHoSearch 设计了两种子图结构:

  • 树结构主要通过放大"搜索空间"来制造难度。
  • 图结构则在巨大搜索空间之上,通过引入环形依赖和交叉约束,进一步叠加了"结构复杂度"。

1.3 质量把关:从生成到验证,层层把关

子图采样完成后,还需要转换为可阅读的自然语言题目。整个转换与验证流程分为三层:

  • 题目生成:从子图抽取维基描述,改写为自然语言问题。
  • 自动验证:检查问题是否完整覆盖子图关系,并由搜索智能体验证标准答案满足所有条件。
  • 筛选与复核:排除多答案题和易答题,再由人工审核。

经过三层筛选,自动化流程的整体质量表现如下:75.5% 的题目直接通过人工复核,22.3% 经标注员微调后接受,仅有 2.2% 因严重问题被丢弃。

1.4 数据概览:544道题目,11个主题领域

LoHoSearch 最终收录 544 道 经人工核验的题目。对比树结构和图结构可以看出,图结构子图明显更稠密——节点更多、边数接近前者的两倍,这正对应它更高的结构复杂度。题目内容覆盖音乐、地理与地点、影视、体育等 11 个主题领域。

表1:LoHoSearch 数据统计

图3:LoHoSearch 的领域分布

表2:各模型在 LoHoSearch 上的性能表现(%)

最强模型 GPT-5.5 准确率仅 34.74%,DeepSeek-V4-Pro、Claude-Opus-4.6 和 Kimi-K2.6 集中在 15.53%–15.99%,其余模型均低于 14%。这与它们在 BrowseComp 上 80% 以上的表现形成鲜明对照——LoHoSearch 对当前最先进搜索智能体构成了实质挑战。

洞察一:解一道题,平均工具调用从 35 次增至 61 次

用 DeepSeek-V4-Flash 作为探针对比两个基准:同一模型在 BrowseComp 上准确率 58.84%,在 LoHoSearch 上仅 10.02%。

图4:BrowseComp 与 LoHoSearch 正确轨迹的工具调用次数分布

解一道 LoHoSearch 题目,平均工具调用从 35 次增至 61 次(+74%),中位数从 26 次升至 59 次。图结构题目准确率仅 8.01%,远低于树结构的 11.89%,印证了结构复杂度是独立于搜索空间之外的额外难度来源。

洞察二:重复采样收益可观,但天花板依然很低

对 DeepSeek-V4-Flash 采样 16 个独立回答,结果如图 5 所示。

图5:并行采样下 pass@N 及三种答案聚合策略的表现

pass@N 从 N=1 的 9.3% 升至 N=16 的 38.3%,重复采样收益可观,但 38.3% 仍处低位。尝试 16 次仍有六成以上题目无法攻克。三种聚合策略中 best-of-N 表现最优(24.6%),远低于 pass@16 上界,说明模型在答案置信度校准上存在明显不足。

洞察三:现有的上下文管理策略,在这里已失真

以标准 ReAct 为基线,测试 Summary 和 Discard-all 两种策略,并加入 Verify 模块。

表3:基于 DeepSeek-V4-Flash 的上下文管理策略消融实验

表现最佳的组合(Discard-all + Verify)将成绩从 10.02% 提至 16.82%,绝对提升仅 6.8 个百分点,而同一套策略在 BrowseComp 上可带来 14 个百分点的增益。收益收窄的原因在于 LoHoSearch 需要更长的推理链,简单的轨迹压缩或重启无法解决长程搜索中的信息丢失问题——这使其成为下一代上下文管理技术更有价值的试验场。

洞察四:知识图谱是系统化构造高难度题目不可或缺的基础

对比两个基准中"隐藏实体"的特征可以发现:

图6:隐藏实体分析(a) 隐藏实体的入度分布;(b) 相同流行度下关系搜索空间对比

其一,BrowseComp 的隐藏实体流行度明显更高,人工出题难以精确控制实体知名度,导致实体偏易。

其二,即便将流行度控制在同一水平,LoHoSearch 的关系搜索空间仍显著更大,实体推断难度远高于 BrowseComp。

这说明人工构建存在系统性局限,知识图谱是系统化构造高难度题目不可或缺的基础。

02 总结:为下一代智能搜索提供新标尺

LoHoSearch 的价值体现在三项具体贡献上:

  • 基于知识图谱的自动化构造流程。 以覆盖762万实体的知识图谱为基础自动生成题目,系统控制搜索空间与结构复杂度,突破人工出题的难度上限。
  • 更具区分度的评测标准。 最强模型 GPT-5.5 准确率仅 34.74%,正确轨迹所需工具调用次数是 BrowseComp 的 1.7 倍。LoHoSearch 为搜索智能体建立了更具区分度的评测标尺。
  • 面向上下文管理研究的挑战性平台。 最优策略仅带来 6.8% 的提升,远低于其在 BrowseComp 上 14.03% 的增益,表明 LoHoSearch 可成为推动下一代上下文管理技术研究的理想试验场。

LoHoSearch 已全面开源,欢迎各大模型前来接受"长程搜索"大考。

开源链接

让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层

假如你出生在一片未知的森林,太阳即将下山,饥肠辘辘,前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。

此时如果你按下暂停,把截图发给所有顶级的多模态大模型,它们都能完美回答你:“黄昏、有怪物,面临威胁。”

我们发现,多模态大模型能看懂图像、解析视频、在复杂场景里推理,然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么?

为了深入探索,美团 LongCat 团队构建了MineExplorer——首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。

MineExplorer 核心看点:

  • 一个能直接跑的评测基准:813 个人工验证的高质量实例(1-hop 到 4-hop),配套规则化的里程碑自动评测框架。
  • 一套造题的方法论:多智能体数据合成流程的完整代码,可自动合成训练任务。
  • 一个可扩展的训练环境:基于 Minecraft 的沙盒,既能当考场,也能当练兵场。

01 MineExplorer设计解密:让AI离开温室,走向动态世界

MineExplorer 不再是简单的看图问答,而是围绕一系列创新,构建了一个前所未有的评测体系。

图1:MineExplorer自动化数据合成和评测范式简介

1.1 创新设计:构建一个动态开放的世界

创新点一:构建一个具备完整物理规则、会动态演化的世界

MineExplorer不是让模型看一张 Minecraft 截图做选择题,模型面对的是一个实时运行的3D沙盒世界。在评测中,每个任务实例会运行1800个环境步,每步执行 0.1 秒,对应一段3分钟的连续交互视频。也就是说在这3分钟时间里,环境一直在变:模型每做一个动作,世界状态就更新一次,它必须根据最新的画面不断调整策略。

创新点二:隐藏前置条件的长程多跳任务

这是 MineExplorer 最核心的设计,我们把任务按「跳数(hop)」分级,代表完成最终目标需要经过的隐藏前置步骤数量:

  • 简单任务:目标明确的单跳任务,智能体不需要根据场景和任务描述推理出隐式的子任务。
  • 困难任务:由2-4跳任务组成的多跳推理任务。最终目标虽然给出,但要完成它,必须先推理并完成若干没有在指令里说明的前置子任务。

我们用一个数学化的方式来刻画这种结构。每个复合任务被定义为一个四元组 τ = (q, s₀, Gτ, Mτ):q 是自然语言指令,s₀ 是初始状态,Gτ 是任务之间的依赖图(DAG),Mτ 是规则化的里程碑检查器。关键在于:**指令 q 并不会枚举依赖图里的所有节点,智能体必须自己从环境里推断出隐藏的前置任务。**一个任务越难,意味着它需要越多样的能力、包含越多隐藏前置、依赖链越深。

图2:任务难度分布图

创新点三:知识解耦——我们测的是「通用探索」,不是「背 Minecraft Wiki」

这是 MineExplorer 区别于以往所有 Minecraft 评测基准的一个关键设计。我们的做法是主动把游戏专有知识剥离掉。对每一个原子任务,我们用LLM裁判判断其主要依赖的是通用世界常识,还是Minecraft专有机制,并过滤掉后者。换句话说:我们测的不是「AI 会不会玩 Minecraft」,而是「AI 能不能在一个动态物理世界里自主探索」。

图3:领域知识过滤图

1.2 构建方法:一套可复用的多智能体数据合成范式

构建高质量的长程任务基准本身就是难题。我们的解法是让一组各有分工的 AI 协作来造题。MineExplorer 用一个多智能体协作流程,五个专业 Agent 在一个群聊里协作,由一个 orchestrator 控制发言顺序:

整个流程分初始化和辩论(debate)两个阶段,先生成初稿,再由专家和验证器找出问题并修订。

下表所示,人工评估结果显示,多智能体流程把有效率拉高了约 30 个百分点,质量分提升约 0.5 分,在最难的4-hop任务上优势尤其明显。最终,我们保留了 813 个通过人工验证的高质量复合任务实例。

表1:Benchmark质量人工评估表

1.3 能力覆盖:MineExplorer 到底在测什么?

MineExplorer 借鉴 ReAct 范式,把开放世界探索拆解成三大能力维度,共 14 项细粒度能力:

  • 感知(Perception): 空间、时序、实体、状态、资源。
  • 推理(Reasoning): 常识、因果、关系。
  • 行动(Action): 移动、跳跃、采集、放置、合成、攻击。

如图所示,最终的基准在三大维度上都有充足的覆盖,其中空间感知、移动、采集等基础能力出现频率最高,常识推理、因果推理也占了相当比例。

图4:能力覆盖分布图

02 核心洞察:18款顶级大模型测试,为何集体“考砸”了?

MineExplorer不仅定义了考题,更给出了18个顶级模型的真实分数。如下表所示,这是横跨 Claude、GPT、Gemini 等八大家族的模型在整体任务成功率(TSR)上的排行榜。

表2:主体评测结果表

我们发现,即便是表现最好的 Claude-Opus-4.6,整体成功率也只有 41 分。

| 洞察一:单跳尚可,多跳崩盘——问题就在隐藏前置条件

如图所示,最强模型Claude-Opus-4.6的表现,从1跳任务的77分,一路下滑到4跳任务的12分。每增加一层隐藏的前置依赖,模型就掉一个台阶。

表3:分级评测结果图

图5:不同任务难度下的任务成功率对比图

| 洞察二:会看,但不会想 —— 感知强于推理

在几乎所有被测模型上,我们都观察到同一个规律:感知分数 > 行动分数 > 推理分数。如下图所示,以Claude-Opus-4.6为例,其整体感知分61.91,推理分54.71。瓶颈不在于看不见,而在于看懂了却无法串联成有效策略。

图6:维度评测热力图

| 洞察三:近60%的失败原因,都是因为走不到目标

我们对 Claude-Opus-4.6 的失败案例进行了归因分析。如下图所示,导航失败是最大的错误来源,占比近 60%。

图7:失败类型分布图

| 洞察四:给它更多步数、更多记忆,都不是解药

我们进一步做了消融实验,发现模型失败并非因为资源不足。

  • 步数:如图所示,能解的任务,模型在早期就解出来了;解不了的,给到 1800 步上限照样解不了。

图8:平均完成步数图

  • 记忆:如图所示,增加历史画面帧数到一定程度后,性能反而会下降,因为过期的观察会干扰对当前局面的判断。

图9:记忆帧数影响图

核心结论:瓶颈不在资源,而在模型没法把已有的信息和当前世界状态对齐。

03 总结:从看见世界到探索世界的鸿沟

MineExplorer 揭示了一个被乐观情绪掩盖的能力断层:当前的多模态大模型,已经具备了不错的感知力,但严重缺乏在动态世界中持续行动的探索力。

这对正在快速升温的具身智能赛道有几个直接的启示:

  • 感知层基本就绪,规划层是瓶颈。 模型能看懂环境,但把感知转化成长程、含隐藏前置的行动计划,才是从能看到能做之间真正的鸿沟。
  • 行业需要更接近真实复杂度的评测标准。在受控场景里跑通一个单步指令,不足以宣布AI能行动了。真实世界是动态的,充满未说明的前置条件,需要持续、长久化的探索。
  • 我们不仅提供了评测,还开源了自动合成任务的方法和训练环境。MineExplorer交付的不是一套静态题库,它还带着一整套自动合成长程任务的流程,和一个能直接拿来训练的Minecraft环境。评测、造题、训练,用的是同一套基础设施。

我们不是要给具身智能泼冷水。恰恰相反,把瓶颈定位清楚,比盲目乐观更有价值。MineExplorer提供的,正是这样一条诚实、可量化的能力基线。

看得见世界,不代表能探索世界。在一个会变化的世界里持续推理、持续行动——这才是AI走向真实世界,必须先跨过的那道门槛。MineExplorer 已全面开源,欢迎各大模型前来挑战开放世界。

🚀 开源链接

正式开源!美团 LongCat-2.0 同步开放国产卡推理代码

本周,美团万亿参数大模型 LongCat-2.0 正式开源!

HuggingFace | GitHub | ModelScope

作为业界首个在五万卡国产算力集群上完成推理的万亿参数模型,LongCat-2.0 已全面开源。针对显存与带宽受限的国产算力芯片,我们在模型架构、芯片适配到部署策略上进行了深度协同优化,让万亿参数模型在存量卡上同样跑得稳、跑得快。 我们希望以真实 Agentic Coding 任务中的稳定表现为依托,通过开源将模型能力与推理优化成果完整开放,盘活更多存量国产算力,释放国产算力生态的长期价值。

美团 LongCat-2.0 总参数 1.6T,平均激活约 48B,为真实的 Agentic Coding 任务而生,架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力的同时,结合动态激活进一步强化了代码理解、生成以及执行的表现。

01 模型、芯片适配与部署三个方向逐一突破,实现了万亿参数模型的流畅推理

面对显存、带宽和互联的多重限制,LongCat-2.0 结合国产芯片特性,从模型、芯片适配与部署三个方向逐一突破,实现了万亿参数模型的流畅推理:

  • 模型层面: Attention 通过 absorb 计算模式、Indexer 与 MLA prolog 并行处理以及 KVP 切分 KV-cache,有效缓解了超长上下文的 I/O 与显存压力。ScMoE 则利用国产芯片的控核能力,让 Dense 与 MoE 分支实现物理核心级并行执行,进一步压缩端到端延迟,实现了百万上下文在国产芯片上的高效推理;

  • 芯片适配层面: 通过 Super Kernel 减少算子数量以降低启动开销,并以 Weight Prefetch 将 I/O 延迟隐藏在前序计算中;同时基于高速片间互联完成 layer-wise 的 KV-cache 传输,TP/SP/KVP 均在 scale-up 互联域内完成,在受限的显存和带宽条件下将硬件利用率最大化;

  • 部署策略层面: 采用 PD 分离部署兼顾 TTFT 与 TPOT:Prefill 端通过缩小 Expert-Parallel 域与序列并行分担长序列计算压力,Decode 端以 KV-cache 切分与高并行度降低单卡显存占用,配合异步化 Expert-Parallel Load Balancing 解决大 EP 度下的负载不均。上述并行方案均已适配 constrained decoding、multi-step scheduling 和 MTP 等推理优化特性,实现了万亿参数模型在国产算力上的稳定服务。

LongCat-2.0 验证了国产芯片承载复杂大模型任务的成熟能力,并希望通过开源为行业提供一条可复现的技术路径,推动存量算力在真实场景中的应用价值。

02 模型全面升级,会执行、会推理、懂交互

LongCat-2.0 沿用了 LongCat-Flash 的整体设计,并围绕 LongCat-2.0 在长上下文、代码任务和智能体场景中的进一步升级,做了三项关键优化:

2.1 LongCat 稀疏注意力机制,提升上下文处理效率

面向智能体任务中的长输入场景,LongCat-2.0 引入 LongCat 稀疏注意力机制(LSA),通过流感知索引、跨层索引和层级化索引三项策略减少碎片化访存和重复索引计算,在保持模型质量的前提下,加速百万级长上下文的训练与推理。

2.2 引入 N-gram Embedding,提升参数利用效率

LongCat-2.0 在 MoE 专家之外引入 N-gram Embedding 作为新的参数扩展路径。在 MoE 稀疏度已接近 97% 的情况下,将 135B 参数投入 N-gram Embedding 的收益远超继续扩充专家。该模块占比控制在总参数 10% 以内,兼顾了参数收益与结构稳定性。

2.3 通过 MOPD 架构在国产算力集群上无缝融合,让模型会执行、会推理、懂交互

后训练阶段,LongCat-2.0 采用多教师在线蒸馏,将专家分为 Agent、推理和交互三类,分别聚焦自主执行、自适应推理和安全对齐等核心能力。最终通过 MOPD 架构在国产算力集群上无缝融合,使模型兼具深度推理、自主执行与精准交互的综合表现。

03 开源开放

LongCat-2.0 的开源,是一次技术路径的公开,也是一次生态邀约。

本次开源同步提供 BF16、FP8 以及 INT8 等多精度版本,全面覆盖不同算力平台的部署需求。同时,我们深度拥抱开源社区,将针对国产算力极致优化的推理成果同步开源。这意味着,即使手上没有最新算力,也能基于现有硬件将 LongCat-2.0 稳定跑起来。

我们希望通过这套开箱即用的推理栈,让更多的国产卡包括老卡,都能流畅部署万亿大模型推理服务,在真实生产力场景发挥更大价值。

🚀 开源链接

Tech Blog: https://longcat.ai/blog/longcat-2.0/

Model Weights:

Inference Code:

API Platform:

直播回放·含 ACL'26 杰出论文 | 美团 AI 顶会论文 32 篇精讲

🏆 近日,ACL 2026 杰出论文奖在圣地亚哥揭晓,全球仅 18 篇入选,美团履约技术团队的《GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR》上榜啦,一键直达视频回放👉🏻 小红书 | B站

图2

如果你正在关注 AI 前沿,这篇内容值得收藏。

2026 年,美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇,进行了 5 大专场直播。

内容涵盖了大模型推理、智能体记忆与自进化、代码智能、多模态交互、超高清视频生成、本地生活搜索等方向——既有底层能力的突破,也有贴近生活服务的落地探索。

如果你错过了直播,或者想再看一遍👇 五场回放都在这里啦,找到你感兴趣的议题,随时开始。

特别感谢所有讲师与筹备团队的倾力支持!也感谢每一位关注美团技术成长的你!❤️

专场一:ACL'26 综合专场

👉 直播回放入口→ 小红书B站

📚 论文简介及下载→ 点这里

专场二:ACL'26 履约团队前沿技术专场

出品人| Jichong Gao 美团高级技术专家、Jun Xu 美团高级技术专家

👉 直播回放入口→ 小红书B站

📚 论文简介及下载→ 点这里

专场三:搜推 ASX 团队专场

出品人| Guojun Yin 美团研究员

👉 直播回放入口→ 小红书B站

📚 论文简介及下载→ 点这里

专场四:ICML'26 通用 Agent 前沿技术专场

出品人| Qi Gu 美团研究员

👉 直播回放入口→ B站

📚 论文简介及下载→ 点这里

专场五:ICML'26 综合专场

👉 直播回放入口→ B站

📚 论文简介及下载→ 点这里

美团 LongCat-2.0 正式发布:在国产算力集群上完成全流程训练与推理的万亿参数模型

6月30日,美团正式发布新一代万亿参数大模型 LongCat-2.0,并将对外开源。

作为业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型(总参数 1.6 T,平均激活约 48 B,动态范围 33B~56B),LongCat-2.0 从零开始预训练,原生支持 1M 超长上下文,其架构设计自始至终围绕一个核心目标:让模型在真实的 Agentic Coding 任务中,更高效、更稳定地完成代码理解、生成与执行

正式版发布前,LongCat-2.0预览版本已通过 OpenRouter 平台和longcat.ai面向全球开发者开放调用——截至目前该模型已跻身 OpenRouter 全球大模型调用量前三,月调用量在 Hermes、Claude Code 和 OpenClaw 分列全球第一、第二和第三位,成为最受全球 Agent 开发者欢迎的模型之一

01 国模国芯全栈协同:完成万亿参数 MoE 模型在国产算力上的稳定训练

LongCat 团队对国产算力的探索始于 2023 年,三年来,团队从千卡起步,逐步攻克算子适配、通信优化、分布式稳定性等基础难题,最终在五万卡集群上完成万亿参数模型的全流程训练与推理。

LongCat-2.0 预训练数据规模超过30Ttokens,覆盖中文、英文、多语言和代码等多类数据;面对万卡级训练中的硬件故障、通信异常、显存压力与数值波动,LongCat 团队从稳定性、正确性和效率三方面攻克国产算力训练难题。

  • 稳定性上,通过卡间通信异常处理、弹性扩缩卡和自动故障恢复,将月均日故障率降低70%以上;
  • 正确性上,通过自研设计确定性算子、Bitwise 一致性验证和参数检测,保障训练结果的可靠,同时基于实践提升关键模块计算精度、优化 Reduce 逻辑;
  • 效率上,通过流水线调度、显存优化和算子级控核,训练 MFU 提升 1.5 倍。

最终,LongCat 实现稳态日吞吐超过1T tokens/day,完成万亿参数 MoE 模型在国产算力上的稳定训练。

在推理阶段,LongCat-2.0 围绕模型、算子和框架进行协同优化:通过大规模专家并行聚合访存带宽,支撑万亿参数 MoE 模型的低延迟解码;将零计算专家机制融入专家并行通信流程,使路由到零专家的 token 真正避免不必要的传输与计算;并针对通信、Attention、GEMM 等核心算子优化调度,结合提前下发与权重预取等框架机制,进一步降低推理链路中的等待开销。

从稳定训练到低延迟推理,LongCat-2.0 验证了我们已具备在国产算力集群上进行大规模模型训练的能力。它不只是“能训出”万亿参数模型,还让万亿参数模型能够在真实任务中稳定运行。

02 让模型在真实 Agentic Coding 任务中更高效、更稳定地完成代码理解、生成与执行

LongCat-2.0 的架构设计始终围绕一个核心目标:让模型在真实 Agentic Coding 任务中更高效、更稳定地完成代码理解、生成与执行

1M超长上下文,让 Agent 看见整个项目。传统模型在处理超过 100K 上下文后就开始“遗忘”前面的内容。LongCat-2.0 采用LongCat Sparse Attention(LSA)稀疏注意力机制,在处理长文本时不再“逐字逐句地看”,而是智能筛选关键信息,将计算量从平方级降至线性级。这使得模型在 100 万 Token 的超长上下文中,依然保持精准的信息定位与理解能力。

零计算专家 + ScMoE,让算力用在刀刃上。代码任务中不同 token 复杂度差异巨大——定义变量名和推导递归算法对算力的需求完全不同。LongCat-2.0 通过零计算专家实现 token 级动态激活(33B~56B),简单 token 不消耗算力,复杂 token 自动获得更多计算资源。

MOPD 多专家融合,一个模型同时擅长写代码、做推理、懂交互。LongCat-2.0 通过 MOPD 架构融合 Agent、Reasoning、Interaction 三组专家能力——Agent Experts 专攻工具调用与自主纠错,Reasoning Experts 深耕数学与 STEM 推理,Interaction Experts 优化指令遵循与交互体验。推理时由门控网络根据任务类型动态调度最擅长的专家,而非简单合并参数。得益于此,模型在编程、推理、交互等维度均表现突出。

LongCat-2.0 通过精细的架构设计,让万亿参数模型在实际任务中更高效、更稳定地发挥能力。

03 在编程能力、真实办公场景的复杂任务处理方面表现优异

综合评测结果显示,LongCat-2.0 凭借卓越的综合性能与稳定的任务表现,在 Code 和 General Agent 场景表现优异

  • 在编程能力方面,LongCat-2.0 展现出扎实的综合实力:在考察深层工程能力的 SWE-bench Pro 中获得 59.5,领先Gemini 3.1 Pro(54.2)、GPT-5.5(58.6)和 Claude Opus 4.6(57.3);在 SWE-bench Multilingual 中取得 77.3 的成绩,与 Claude Opus 4.6(77.8)保持在同一水位;此外,在真实终端指令交互评测 Terminal-Bench 2.1 中取得 70.8,体现了其在真实运维与开发终端任务中的稳定执行与纠错能力。
  • 在真实办公场景的复杂任务处理方面,LongCat-2.0 表现均衡:在搜索智能体评测集RWSearch中获得 78.8,在生产力场景评测集 FORTE 中获得 73.2 ,在 BrowseComp 中获得 79.9,均达到或接近前沿闭源模型水平,证明了其在多步骤任务规划、复杂工具调用及长程检索执行上的高可靠性,能够较好的契合企业级 Agent 的落地需求。

04 在真实工作场景中,成为大家可靠的“工作伙伴”

内测期间,我们面向真实工作场景征集了大量真实的用户任务需求,这些来自一线的真实“工作单”,可以看出 LongCat-2.0 在用户的真实工作场景中正在成为他们可靠的“工作伙伴”。

Agent 搭建:一问即得,全闭环交付

通过 LongCat-2.0 搭建的 AI SQL Agent,业务人员可以直接用自然语言查询数据。LongCat-2.0 自动完成全链路闭环——理解问题意图、规划查询步骤,并将数据结果转化为清晰的业务洞察。

查看视频

代码库迁移:读懂老代码,重构新架构

给 LongCat-2.0 一个旧版插件代码库和一份新版SDK文档,它能自行分析整体架构、梳理核心逻辑,再将整个插件重构为符合新API的实现——保留全部原有功能,修复潜在隐患,编译一次通过。

查看视频

完整应用开发:从一句话到可运行产品

描述一个“儿童AI游戏训练场”的创意,LongCat-2.0 会逐步生成技术选型、页面架构、游戏逻辑与视觉细节——从首页到三个完整可玩的游戏页面,全部代码一次产出,开箱即用。从一句话到可用的产品,将灵感轻松实现。

查看视频

3D交互演示:一句话,生成一个3D世界

通过一句话描述,LongCat-2.0 即可生成完整 Three.js 3D 演示:透明烧瓶、荧光液体、泡沫喷发、液面下降和堆积效果全部可交互呈现。所有代码封装在一个 HTML 文件中,打开即用,让创意快速转化为可交互的3D体验。

查看视频

AI 小说工厂:从单点灵感到商业变现

基于 LongCat-2.0 构建的“AI小说工厂”,将创意写作升级为自动化内容流水线。用户输入灵感后,系统编排多个 Agent,自动完成世界观构建、并行章节生成、质量评估与回流修订。并通过长上下文能力保障百万字级设定一致性。最终内容可自动适配多平台发布,并由 Web 面板实时监控生成进度与质量状态,实现持续稳定的连载输出。

查看视频

立即体验