在大语言模型(LLM)技术的深刻影响下,搜索引擎正经历第三次范式跃迁:从 1.0 时代的“关键词文本匹配”,到 2.0 时代的“行为统计与个性化搜索”,再到 3.0 时代向“复杂意图理解与认知决策”的全面进化。
美团搜索团队正依托团垂融合新架构与生成式大模型新技术,全面重构本地生活搜索底座。本系列技术博客将持续介绍美团搜索 3.0 的技术探索,本文聚焦 LLM 语义表征在服务零售排序场景上的三期实践——从单点特征验证到系统性表征体系构建,再到跨场景迁移复用,探索语义匹配信号在搜索排序中的应用路径。
服务零售是将服务销售给最终消费者的商业活动,与之对应的概念为商品零售。服务零售和商品零售是美团零售业务的两个主要组成部分。
在美团搜索场景下,相较于到家和其他到店业务,服务零售具有以下显著特点:
传统精排模型的语义建模高度依赖文本匹配,但这类特征构建成本高、泛化能力弱,在面对服务零售大量长尾品类、复杂 Query 意图时尤为明显。例如,"宠物 SPA+洗澡"这个 Query 对应的商品名称可能是"萌宠清洁护理套餐"、"春节大扫除"这个 Query 对应的商品名称可能是"深度保洁服务套餐",在这些 Case 中,搜索词和供给在文字上几乎没有重叠,但语义上是高度相关的。
这类语义 Gap 在美团服务零售搜索场景(生活服务、休闲娱乐等)尤为突出。服务零售的品类长尾分散、商品描述非结构化、Query 意图复杂多样,传统特征工程难以覆盖。而大语言模型(LLM)在语义理解方面的能力成熟度正在快速提升,给我们带来了新的解题思路。
从 2025 年 Q4 到 2026 年 Q2,服务零售搜索排序团队系统性地探索了 LLM 在精排模型中的应用,核心方向是用 LLM 为搜索词(Query)、商家(POI)和商品(Deal)生成高质量的语义向量表征,将语义匹配信息以 cosine 相似度的形式注入排序模型,弥补传统特征在语义理解上的不足。经过三期迭代,累计完成 3 个 Launch Review(LR),均已完成全量上线,带来了显著的线上收益。
下图展示了三期技术演进的整体脉络。每一期都在前一期的基础上进行系统性升级,从验证可行性到全面优化再到跨模块迁移复用,逐步构建起一套完整的语义表征体系。

服务零售精排在语义层面的建模几乎为零,排序模型主要依赖少量文本匹配和 Query 统计类特征。所以一期的目标很纯粹:验证 LLM 表征能否对精排模型有实质性帮助。如果用 LLM 生成的语义向量能带来正向收益,就值得投入更多资源深度优化。整个一期的设计都围绕「先把路走通」。
整体思路是:选择一个轻量级的 LLM 作为基座,对 Query 和 POI 的信息进行统一建模,通过微调,使模型仅依赖文本语义来判断"这个搜索词和这个商家是否匹配",然后全量推理出 Query 和 POI 各自的语义向量,计算它们的 cosine 相似度,作为特征注入精排模型。
模型设计:特殊 Token 与信息隔离
一期选用小参数量的开源基座模型,采用全参数微调。
要提取语义表征,需要一个明确的"聚合点"——模型在哪个位置把输入文本的语义信息汇聚成一个向量。直接用序列末尾 Token 或整个 Token 序列 Mean Pooling 也可以,但缺少可学习性。一期的核心设计是在词表中新增三个特殊 Token——<|query|>、<|item|>、<|qi|>,作为专门的聚合锚点,在训练中与模型参数一起优化。特殊 Token 的嵌入采用平均初始化法,参考 vocab-expansion[1]。
输入 Prompt 的结构如下:
prompt = """用户查询:{}<|query|>
候选商铺信息如下:
商铺名称:{}
热销商品:{}
所属品牌:{}
商铺分类:{} - {} - {}
用户评分:{}分
平均价格:{}元
所在商圈:{}<|item|>
请判断该商铺是否匹配用户查询<|qi|>"""
设计三个而非一个 Token,是因为需要三种不同类型的表征:<|query|> 聚合 Query 侧语义,<|item|> 聚合 item 侧语义,<|qi|> 聚合双侧融合信息——前两者用于推理时独立提取各自的 Embedding 并计算 cosine 相似度,后者仅用于微调时的辅助 Loss。
三个特殊 Token 内嵌在同一条 Prompt 序列中,意味着训练时 Query 和 item 的文本信息是混在一条序列里的。如果不加干预,<|query|> 会自然"看到"后面的 item 文本,<|item|> 也会"看到"前面的 Query 文本。这本身对 <|qi|> 不是问题——它本来就要看两侧信息。但对 <|query|> 和 <|item|> 来说是个问题:推理时,Query 和 item 的 Embedding 是分别独立生成的,如果训练时 <|query|> "看到"了 item 信息,它学到的表征就会依赖 item 上下文,推理时只输入 Query 文本,产出的表征就失去了意义。
因此,通过 Attention Mask 对同一条输入序列进行三次独立 forward pass:提取 query 表征时,mask 将注意力范围限制在 Query 文本段,<|query|> 只能聚合查询信息;提取 item 表征时,mask 限制在 item 文本段,<|item|> 只能聚合商家信息;提取融合表征时使用完整 mask,<|qi|> 可以 attend 到整条序列。这样确保了 Query 和 item 各自的表征是自包含的,可以独立提取和存储。
表征提取方式是取 transformer 最后一层在特殊 Token 位置的 hidden state,经两层 MLP(hidden_size → 512 → ReLU → LayerNorm → 64)降至 64 维,作为最终的目标语义表征。
训练数据与目标
从服务零售垂直搜索链路的精排日志中抽取近 2 个月、共 3,000 余万条训练样本,其中下单:点击未下单:未点击 = 1:3:6。训练目标包含两个 Loss 协同优化:
<|query|> 和 <|item|> 单侧表征的 cosine 相似度,经可学习温度参数缩放后做二分类交叉熵,让模型从语义层面学习匹配程度;
Loss_2 基于 <|qi|> 融合 query 和 item 的双侧信息,经 MLP 后预测点击率,目的是让学到的语义表征对齐下游排序目标。

最终 Loss:L = Loss_1 + Loss_2。
双 Loss 设计的目的是让模型同时学习"单侧表征的质量"和"双侧匹配的判断"——前者直接服务于推理时的 cosine 相似度计算,后者辅助表征对齐下游点击率预估目标。
从模型到特征:推理、分桶与注入
推理时分别独立生成 Query 和 item 的语义 Embedding,离线存储至 Hive 表,按天例行增量更新。
模型推理

精排模型集成

模型获得语义 Embedding 后,计算 Query 与 item 的 cosine 相似度,并按预设的分桶边界将相似度划分进 10 个分桶。分桶边界为[-0.40, -0.30, -0.18, -0.12, 0.00, 0.10, 0.16, 0.22, 0.30],设计时考虑了每个桶内的样本量分布,并尽可能区分下单与未下单、点击与未点击等行为标签。
通过抽取 2 万条搜索曝光样本,我们验证了不同类型样本在各分桶中的分布。如下图所示,Query 和 item 语义越相似,点击/下单的样本占比越高:

这意味着我们可以将 Query 和 item 的语义表征相似度作为一个强特征引入排序模型,以提升模型在点击/下单率预估方面的表现。
为了实现这一目标,我们为每个分桶分配一个可学习的 Embedding 向量(12 维),拼接到精排模型现有特征中。使用分桶而非直接使用连续相似度值的原因是:离散化后的特征能更好地被精排模型的特征交叉网络利用,同时降低噪声敏感度。使用可学习的 Embedding 向量则是为了增强模型对于不同相似度区间的表达能力。
离线验证显示,引入表征特征后点击 NDCG +9bp,下单 NDCG +13bp,验证了方案的有效性。
实验周期 2025 年 9 月 18 日至 10 月 1 日,20%流量 14 天,AA 校验通过。
大盘搜索支付订单显著+0.20%,服务零售订单显著+0.27%。更值得关注的是体验指标的表现:长尾 NDCG@5 显著+2.21pp,长尾 BadCase@1 显著-2.96pp。语义理解提升在长尾场景体感最明显——这正符合预期,因为长尾 Query 恰恰是传统词面匹配最薄弱的地方。
一个只有 64 维的语义表征,仅通过分桶拼接的方式注入精排,就带来了显著的订单增量——这个结果直接证明了 LLM 语义表征在精排场景的价值,坚定了后续深度投入的信心。
一期验证了 LLM 表征在精排中的可行性,但也暴露了四个明显短板。一是只覆盖 Query-商家两端,商品侧语义完全缺失——而在服务零售场景中,用户很多时候是在搜商品而非搜商家。二是全参数微调训练成本高、维护困难,不利于快速迭代。三是微调目标以点击率预估为主,对排序优化不够全面——下游精排同时也关注成单目标。四是三次 Forward Pass 的推理效率有优化空间,表征提取方式还有更高效的替代。这些问题成为二期系统性升级的起点。
一期验证了 LLM 表征在精排中的可行性,但四个短板制约了进一步迭代:仅覆盖 Query-商家两端,缺失商品语义、全参数微调成本高、点击率分类目标对排序不够全面、三次 Forward Pass 效率低。二期的目标不是单点优化,而是系统性重构表征生产的全流程——从训练数据、基座模型、微调方式、表征提取、降维方式到损失函数,逐一对应一期的短板进行升级,同时将下挂商品(Deal)纳入建模,构建 Query-POI-Deal 三元语义表征体系。
贯穿二期的核心矛盾是:一期的训练目标是"判断 Query 和商家是否匹配"的二分类问题,但排序模型真正需要的是"在多个候选中哪个更匹配"的相对序关系。这个矛盾直接驱动了从点击率分类到对比学习的损失函数重设计,也间接影响了训练数据构建(需要难负样本)、表征提取方式(需要更高效的聚合)等其他模块的决策。

训练数据:从单条样本到五元组
一期每条样本只有 Query 和 POI 两部分,用于对齐下游目标的训练信号是"是否点击"。二期将每条样本扩展为五元组:Query、Deal 正样本、POI 正样本、Deal 难负样本、POI 难负样本。难负样本的选取是关键——Deal 难负样本来自同一请求、同一商家下曝光但未点击的商品,POI 难负样本来自同一请求下曝光但未点击的商家。这种"同请求"的难负采样策略确保了负样本与正样本在 Query 意图和上下文上高度相似,只在"是否被用户选择"上有差异,能迫使模型学到更精细的判别能力。最终我们构建了 2766 万条训练样本。
Prompt 设计:反直觉的发现
确定了"喂什么数据"后,下一步是"怎么组织成文本"。我们尝试了多种 Prompt 方案:精简信息陈述+总结引导、简单任务指令、丰富版任务指令、仅信息陈述。实验发现一个反直觉的结论:精简信息陈述+总结引导效果最好,过于复杂的任务指令反而降低表征质量。

这与常见的 LLM 问答任务的直觉相反。我们推测原因是:在 Embedding 训练场景中,Prompt 的作用是引导模型理解"要聚合哪些语义信息",而非传统的"指令遵循"。过于复杂的指令会干扰模型对核心语义信息的聚合,就像给一个本该专注于理解文本的人过多任务要求,反而分散了注意力。这一结论对后续其他表征场景有直接参考价值。
具体的 Prompt 如下:
二期在商家的 Prompt 中也新增了"次级经营品类"、"热销商品"等信息,以期望学到更完整的商家语义表征。
一个值得注意的实验发现是:我们尝试在商品特征中引入 CPV(商品属性)信息后,排序评估效果反而下降:

我们推测原因是当前 CPV 信息过于繁杂,未经筛选地引入反而会带来噪声。这个反直觉的结果说明,在表征训练中,信息质量比信息量更重要。
基座模型与微调方式:从全参到 LoRA
基座模型选择上,我们横向对比了参数量在 0.5B~8B 的多个模型,涵盖通用、Embedding、Instruct 等多个系列。
实验发现,中等参数档位是效果与推理成本的最优平衡点——更大的模型在 NDCG 指标上提升有限且推理成本显著上升;最小参数档位则在各项指标上全面落后。最终选定专门为文本表征任务优化的 Embedding 模型变体,它在 Click-AUC 和 NDCG 上均优于同参数量的通用模型。
微调方式从全参数微调切换到 LoRA[3](r=8、α=32,目标模块 q_proj 和 v_proj)。对比实验显示一个有趣的现象:LoRA 在 NDCG 指标上优于全参数微调,但全参在 AUC 上略有优势。这一现象仅在本场景中观察到,是否具有普适性有待验证。综合考虑训练效率和维护成本最终选择 LoRA。
表征提取:从三 Token 单序列到独立序列+可学习向量
一期在同一条序列中内嵌三个词表 Token,通过三次 Forward Pass 和不同 AttentiOn Mask 实现信息隔离,推理效率低。二期彻底重构了表征提取方式:不再将 Query 和 item 放在同一条序列中,而是各自在独立的序列中处理;特殊 Token 不再是 vocabulary token,而是 nn.Parameter——一个维度为 hidden_size 的可学习向量。具体做法是:对输入文本做 tokenize 后取 input embeddings,找到序列中最后一个有效位置,将该位置的 Embedding 覆写为对应的可学习向量,经过 Transformer 后取该位置的 hidden state 作为表征。Query、POI、Deal 各有独立的可学习向量。
这种设计相比一期有几方面优势:不再需要 Attention Mask 隔离(因为各实体本就在独立序列中处理),一次 Forward 可以同时处理五路输入(五元组的各部分拼接在 batch 维度上),推理效率大幅提升。同时,可学习向量直接作为"聚合锚点"放在序列末尾,模型在训练中学会在该位置汇聚全序列的语义信息。
对比实验显示,Last Special Token Embedding 优于 Mean Pooling 和直接取最后一个有效 Token,推测原因是可学习的特殊 Token 比固定位置或平均池化更能有效聚合序列信息并区分不同实体类型。
降维方式:从 Linear 到 MRL-E
一期用两层 MLP 将 hidden state 降至 64 维。二期改用 MRL-E[4](Matryoshka Representation Learning)策略:设置嵌套维度列表[1024, 512, 256, 128],训练时对每个维度分别计算损失并取平均,推理时直接截取前 128 维。
MRL-E 相比 Linear 降维的核心优势不在于精度提升(离线指标差异不大),而在于灵活性:同一套训练出的表征可以根据不同场景的效率需求选择不同维度,无需重新训练。这在后续三期将表征迁移到下挂精排时体现了价值——不同模块对 Embedding 维度的要求可能不同,MRL-E 提供了开箱即用的多尺度选择。因此我们选择 MRL-E 作为最终降维方案。
损失函数:从分类到对比学习
这是二期最核心的升级,也是"从分类到排序"这一核心矛盾的直接解法。
一期用 BCE Loss 做点击率二分类,模型只学到"是否匹配"的绝对判断。但排序模型需要的是相对序——在多个候选中哪个更匹配。InfoNCE Loss[5]天然面向这个目标:它利用 Batch 内负样本构建对比任务,最大化正样本对相似度的同时最小化与 batch 内其他样本的相似度,本质上是在做"从 N 个候选中选出正确匹配"的排序训练。
我们具体设计了三组 InfoNCE Loss:Query↔POI、Query↔Deal、POI↔Deal。三组对比覆盖了三元实体间所有两两关系,使表征空间同时编码 Query-商家匹配度、Query-商品匹配度和商家-商品一致性。采用归一化嵌入后的内积作为相似度度量,温度参数可学习:


但如果 InfoNCE 的负样本仅来自 Batch 内随机采样,难度不够——大部分 Batch 内负样本与 Query 的语义差距很明显,模型不费力就能区分。为此我们引入 Triplet Loss 专门处理构建出的难负样本:采用欧氏距离,margin=0.5,分别计算 Query-POI 和 Query-Deal 的 Triplet Loss。难负样本是"同请求同商家曝光未点击"的样本,与正样本在 Query 意图和上下文上高度相似,只在用户选择上有差异——这才是模型真正需要学会区分的。

消融实验验证了这一设计:引入 Triplet Loss 后,Q2I-Click-AUC[7] +4.85pp,Q2I-Order-AUC +11.02pp。Order-AUC 的提升幅度远高于 Click-AUC,说明难负样本建模对排序下单信号的捕获比点击信号更难、但更有价值——这也印证了"从分类到排序"的转型方向是正确的。

最终的训练目标为上述五个损失的加权和:

二期相比一期在多项关键指标上取得了显著提升:Q2I-Click-AUC 提升 6.25pp、Q2I-Order-AUC 提升 5.37pp、Q2I-Click-NDCG 提升 1.77pp、Q2I-Order-NDCG 提升 2.03pp。
相似度分桶策略升级
沿用一期的相似度分桶机制,但进行了两项升级。一是从单组相似度扩展到双组——同时计算 Query-POI 和 Query-Deal 的 cosine 相似度,各自分桶,使模型能分别利用 Query-商家和 Query-商品的语义匹配信号。二是引入零向量边界,用于捕获无表征样本(缺失表征置为零向量,并在特征计算中进入专门的缺失值分桶),确保未覆盖样本落入同一桶中,避免无表征样本的噪声干扰。
底层+顶层双重融合
表征信息通过底层和顶层两种方式融入精排模型。底层融合将分桶 Embedding 与精排模型现有特征拼接,参与特征交叉学习;顶层融合将原始 cosine 相似度直接在顶层拼接,经一层 LHUC 后用于 CTR 和 CTCVR 预测。
为什么要同时做底层和顶层?底层融合让语义特征参与特征交叉,能与其他特征产生交互效应,但经过分桶离散化后丢失了相似度的连续信息。顶层融合直接使用原始 cosine 相似度,保留了连续语义信号,但无法参与特征交叉。两者互补——加入顶层融合后点击 NDCG +5bp,下单 NDCG +3bp。
加载方式优化
一期采用 HashTable 热启方式加载表征,但二期引入 Deal 表征且维度从 64 维扩展至 128 维后,若沿用热启方式,模型体积将成倍增长,带来明显的存储和部署压力。为此,在工程实现上,二期优化为"离线训练样本化+线上 KV 读取"方案:离线训练时表征以样本特征形式引入,随样本一同加载;线上服务时从 KV 存储实时读取表征向量。优化后模型体积不增反降,相比一期基线还略有缩减,在牺牲部分应用灵活性的前提下解决了存储和部署压力。
实验周期 2026 年 3 月 17 日至 3 月 23 日,20%流量 7 天,AA 校验通过。
搜索大盘搜索 UV 显著+0.07%,有效点击 QV 显著+0.13%,服务零售结果页有效 QV_CTR 显著+0.10pp(+0.15%)。性能上 TP90 仅+0.2ms。
线上数据中出现了一个值得分析的现象:服务零售搜索 QV 略有下降(-0.05%,不显著),但有效点击 QV 正向(+0.09%,不显著),结果页 QV_CTR 显著正向。下钻分析发现,QV 下降主要集中在美团某事业部(-0.70%,显著),但该事业部的 QV_CTR 反而提升了0.24pp(显著)。原因是实验组优化了排序结果,减少了无效曝光——部分此前会被曝光但不会被点击的结果被更相关的结果替代,虽然总曝光量下降,但转化效率提升。线上排序指标印证了这一判断:实验组点击 NDCG@30 +6bp,点击 GAUC +13bp。
这个现象说明,语义表征的引入不仅是"增加曝光机会",更重要的是"优化曝光质量"——让更匹配的商品和商家排在前面,即使用户看到的选项变少了,转化效率反而更高。
商家精排两期的表征体系已成熟,但下挂精排——对商家下挂的具体商品进行排序——在语义维度的建模几乎为零。三期的核心逻辑是:复用二期已训练的表征模型,将成熟方案平移到下挂精排。这看起来是最自然的延伸,但实际执行中遇到了意料之外的挑战。
与表征迁移同步进行的,还有一项系统性特征治理工作。团队对下挂精排特征进行了全面梳理,发现部分特征已失效,同时在"个性化×商品"和"Query 意图×商品"两个交叉维度上存在建模空白。因此三期是"大模型表征迁移"和"全域交叉统计特征补充"两条线并行推进,最终以叠加效果上线。
扩大覆盖率:迁移的第一道关卡
表征模型直接复用二期,但表征的"覆盖范围"不能直接复用。二期的 Query Embedding 是基于商家精排样本圈选的——即只对商家精排中出现的 Query 生成 Embedding。直接迁移到下挂精排时,Query 覆盖率仅 81.24%,双覆盖率(Query+Deal 同时有 Embedding)更只有 73.61%。
原因在于两个场景的 Query 分布有本质差异。商家精排的 Query 偏向商家意图词(如"SPA"),而下挂精排的 Query 更多是商品意图词(如"双人 XX 套餐")——用户在商家列表页搜索的是"找什么样的店",进入下挂排序时搜索的是"买什么样的商品"。这些商品意图词在商户样本中可能从未出现,自然没有对应的 Embedding。
解决方案是重新用下挂精排的样本分布圈选 Query Embedding 的生成范围。修复后 Query 覆盖率升至 98.92%,双覆盖率达 89.81%。
这个工程细节看起来不起眼,但它直接决定了特征有效性。修复前的 73.61% 双覆盖率意味着超过四分之一的样本拿不到语义匹配信号——如果带着这个缺口上线,特征的价值会被严重稀释。这一经验也成为了跨模块复用表征的标准 checklist:表征模型的迁移不是直接复用模型参数,必须针对目标场景的样本分布重新圈选 Embedding 覆盖范围。
特征有效性前置验证
补充完 Embedding 后,团队先做了一项前置验证:将 Query 和 Deal 的 Embedding cosine 特征等距分为 100 个桶,分别计算每个桶内各 label(成单、货架成单、点击、全域成单)的平均值。结果显示随着 cosine 分数单调上升,所有 label 均值也单调上升,方向明确。这个验证虽然简单,但它回答了一个关键问题:迁移过来的表征在下挂场景是否依然有效?答案是肯定的——Query-Deal 的语义匹配度与用户行为之间存在清晰的正相关。
分桶策略:一种特征,五个视角
cosine 相似度与 label 虽然正相关,但并非严格线性。为了让特征分桶与各 label 呈现更强的正相关性,团队设计了 5 种分桶策略:等样本量分桶(V1,每个桶内样本数相等)、按下挂成单 label 均值等差分桶(V2)、按货架成单 label 均值等差分桶(V3)、以及在下挂曝光样本和货架曝光样本上分别按对应 label 等差分桶(V4、V5)。
为什么要设计 5 种而不是选 1 种?因为下挂精排同时优化多个目标(点击、下挂成单、货架成单),不同目标与 cosine 分数的关系曲线不同。等样本量分桶对综合目标最优,而按特定 label 等差分桶则在该 label 的方向上更敏感。Droprank 特征重要性分析也印证了这一点:V1(等样本量分桶)综合重要性最高(排名第21),但 V2、V3、V4 也分别排在第40、164、129 位——它们从不同方向对模型有独立贡献。

应用方式:从底层拼接到 PEPNet 门控
三期在表征与模型的耦合方式上做了系统探索。对比了 4 种方案:底层拼接交叉统计特征(+7bp)、底层拼接 LLM 相似度+交叉统计特征(+18bp)、LLM 相似度放在输出塔前(+8bp,且部分指标负向)、PEPNet 门控注入[8](+25bp)。
为什么 PEPNet 门控效果最优?底层拼接让语义特征参与特征交叉,但经过分桶离散化后信号被压缩;输出塔前注入保留了连续相似度信号,但无法与模型其他特征交互。PEPNet 门控机制的优势在于:它将语义相似度作为"门控信号"调制模型其他特征的权重——高语义匹配时放大相关特征的贡献,低匹配时抑制。这种自适应调节比固定位置的拼接更灵活,离线 ctcvr_auc_global_poi +25bp,远高于底层拼接的 +18bp。

全域交叉统计特征:语义维度之外
在大模型表征之外,三期还补充了四类全域交叉统计特征:user×deal id 体系交叉统计、POI 的 cate3 统计特征、user×POI 的 cate3 交叉统计、query×deal id 体系交叉统计。这四类特征弥补了下挂精排在"个性化×商品"和"Query 意图×商品"两个交叉维度上的建模空白。其中订单及转化相关特征因覆盖率极低(低于 0.1%),在消融实验中被移除——这也是一个值得注意的经验:统计特征的价值不仅取决于相关性,还取决于覆盖面,覆盖率太低的特征即使方向正确也难以产生实际收益。
实验周期 2026 年 5 月 28 日至 6 月 3 日,10%流量 7 天,AA 校验通过。
服务零售业务订单显著 +0.32%,服务零售访购率显著 +0.29%,搜索大盘支付订单显著+0.35%,大盘访购率显著 +0.25%。
三期的 +0.32% 订单是大模型表征和全域交叉统计特征两类特征叠加的结果。两类特征在离线均单独验证正向,但叠加效应比预期更强。这说明语义维度(LLM 表征)和统计维度(交叉特征)在捕获用户偏好上存在互补性——语义特征捕捉的是" Query 和商品在语义上是否匹配",统计特征捕捉的是"具有某种行为的用户是否偏好这类商品",两者从不同角度刻画了用户-商品的匹配关系,叠加后形成了更完整的判断。
三期迭代的技术细节已在前文展开,这里不再复述,而是聚焦于几条跨阶段的、对后续工作有直接指导意义的判断。
1、中等参数量是当前阶段的最优平衡点,但不一定是终局。 在 0.5B~8B 的参数量区间内,中等档位模型在效果与推理成本上取得了最优平衡。专门为表征任务优化的 Embedding 变体优于同参数量的通用模型。但这个结论有阶段局限性:随着推理优化技术(量化、蒸馏、推测解码)的成熟,更大模型的推理成本会持续下降,最优平衡点也会上移。因此更本质的认知是——表征模型的选型不应追求"最大可用",而应在当前推理预算下选择效果最优的,并定期重新评估。
2、 难负样本是提升表征判别能力的关键。一期使用点击率分类目标,模型只学到"是否匹配"的绝对判断,表征的判别能力有限。二期引入"同请求同商家曝光未点击"的难负样本,配合 InfoNCE + Triplet 对比学习框架后,离线指标大幅提升。难负样本的核心价值在于:它迫使模型学习"在高度相似的候选中,用户为什么选了这个而非那个"——这种精细判别能力是单纯靠正样本和随机负样本无法获得的。在构建表征训练数据时,难负样本的质量直接决定了表征质量的上限。
3、 Embedding 场景的 Prompt,做减法比做加法有效。 在传统 LLM 任务中,更详细的指令通常带来更好的效果。但在 Embedding 训练场景,精简信息陈述+总结引导优于复杂的任务指令和推理链。原因是 Embedding 的 Prompt 作用是"引导模型聚合哪些语义信息",而非"指导模型完成什么任务"——过多的任务指令会干扰模型对核心语义的聚焦。这一结论与传统 LLM 任务的直觉相反,对后续其他表征场景有直接参考价值:写 Embedding 的 Prompt 时,问自己"模型需要从这段文字中聚合什么信息",而不是"模型需要完成什么任务"。
4、 表征迁移的核心风险不在模型,而在覆盖率。 三期最大的工程挑战不是模型适配,而是 Query 覆盖率从 81.24% 到 98.92% 的修复。表征模型的参数可以直接复用,但 Embedding 的覆盖范围必须针对目标场景重新圈选——否则覆盖率缺口会直接压低特征有效性。这条经验看似简单,但容易被忽略,因为"复用模型"天然暗示着"可以直接上线"。后续任何跨模块迁移表征的工作,都应将覆盖率验证作为第一步 Checklist。
5、语义特征和统计特征是互补的,不是替代的。 三期的 +0.32% 订单是两类特征叠加的结果,且叠加效应比预期更强。语义特征从"Query 和商品在语义上是否匹配"的角度刻画用户-商品关系,统计特征从"具有某种行为的用户是否偏好这类商品"的角度刻画——前者是内容理解,后者是行为模式。两者各自有盲区,叠加后形成了更完整的判断。这意味着在特征体系设计中,不应将"大模型表征"和"传统统计特征"视为二选一的方向,而应将它们作为互补的信号源协同设计。
本工作处于"LLM 文本表征"与"搜索排序特征工程"的交叉地带。为厘清本工作在技术版图中的位置,从三个维度梳理业内工作。
维度一:文本表征模型(Producer)
文本表征领域经历了从 Word2Vec 到 BERT 再到 LLM 的演进。以 E5[9]、BGE[10](BAAI)、GTE[11](阿里通义)系列为代表,训练范式以 in-batch negatives + InfoNCE 为标准配方。2025 年基于 LLM 的表征模型成为主流,代表工作有 Qwen3-Embedding(false-negative mask)、Conan-embedding[12](动态硬负样本挖掘)、Llama-Embed-Nemotron[13](纯难负样本 InfoNCE)。这些工作的共同关注点是负例质量——"embedding 质量的天花板在负例质量,不在 backbone"已成为业界共识。在降维策略上,MRL 提供了多尺度可截断方案;高效微调方面,LoRA 成为参数高效微调的事实标准。
维度二:表征在排序中的应用(Consumer)
在表征如何融入排序模型这一问题上,业内存在多条路线。TIGER[14]开创了生成式检索范式,将 Embedding 量化为分层 Semantic ID 用于序列召回,但未直接用于判别式排序。在判别式排序中,表征的注入方式正在从简单拼接向门控和自适应融合演进:UNGER[15]指出语义与协同 Embedding 直接拼接时语义信号会占据主导,需显式模态平衡。
维度三:难负样本策略
难负样本是表征质量的关键杠杆。ANCE[16]首次提出用异步 ANN 索引从全局语料库采样难负样本,解决了 in-batch negatives 信息量不足的问题。此后业界发展出多种策略:Meta 的 realtime hard neg 使用 LLM 聚类后的同簇 OOB 负样本配合 LogQ 校正;Apple Music 的 Elise 采用课程式调度——前期用 InfoNCE 构建全局结构,后期切换到最难 Hinge Loss 锐化边界;小红书的 Uninote 提出多粒度难负挖掘与 JS 散度软标签。这些策略的共性是:从随机负样本转向"够难但不是假负例"的精细构造。
独立创新点
将上述工作作为参照系,本工作在以下方面具有独立创新性:
1、面向搜索排序的语义相似度直接特征注入。业界表征工作以推荐场景为主,表征主要作为底层特征拼接(如 TIGER 的 SID embedding),与排序目标之间的映射是隐式的。本工作基于搜索场景特点,将 query 与供给的 cosine 语义相似度作为直接特征注入精排——分桶离散化参与特征交叉(底层融合),同时保留连续相似度在输出塔前直接参与预测(顶层融合)。这种做法相比推荐场景的底层拼接有两方面优势:一是语义相似度直接刻画"搜索词与供给是否匹配",与搜索排序目标天然对齐,方案更具可解释性;二是底层 + 顶层的双重融合设计兼顾了特征交叉能力和信号保真度,比单一注入方式更充分地利用了语义信号。
2、基于"店+下挂商品"展示结构的难负样本构造。利用美团搜索"店+下挂商品"的两层展示结构,构造"同请求、同商家、曝光未点击"的下挂商品作为难负样本。这类样本与正样本在 query 意图和上下文上高度相似(同一搜索词、同一商家),仅在用户选择上有差异——迫使模型学习"在高度相似的候选中,用户为什么选了这个而非那个"。相比 ANCE 的全局 ANN 难负采样,本方案的难负样本天然绑定了搜索场景的上下文信息(同一请求、同一商家),难度更高且更贴近排序任务的真实分布。消融实验显示,引入此类难负样本后 Q2I-Order-AUC 提升11.02pp,远高于 Click-AUC 的4.85pp,验证了"从分类到排序"转型方向的有效性。
3、Query/POI/Deal 三元实体联合表征。业界文本表征工作以两元对(query-document 或 user-item)为标准建模单元。本工作面向服务零售"搜索词→商家→商品"的三元匹配结构,设计了三组 InfoNCE Loss(Query↔POI、Query↔Deal、POI↔Deal)覆盖三元实体间所有两两关系,使表征空间同时编码 Query-商家匹配度、Query-商品匹配度和商家-商品一致性。这种三元联合对比学习在公开文献中较少见,其设计动机直接来自业务场景——用户在服务零售搜索中既需要找到对的商家,也需要找到对的商品,二者构成层次化匹配关系。
基于三期迭代积累的经验和前沿技术调研,后续有四个值得探索的方向。
1、负例质量提升:当前表征训练的最大洼地。 二期的负例策略是 in-batch 随机负样本+单显式难负样本,已有不错效果,但前沿实践表明这个方向还有很大空间。 Qwen3 Embedding 工作[17]提出了 false-negative mask——把疑似假负例从 InfoNCE 分母中剔除,是零结构改动的即插项;KALM v2[18]的 focal-style 难度重加权让训练聚焦真难例;Nemotron 的相似度阈值筛选只保留"够难但不是假负例"的区间。这些方法的共同认知是:Embedding 质量的天花板在负例质量,不在 backbone。当前仅采用 in-batch 随机负样本 + 单个显式难负样本,负例构造仍是明显短板,优先补这一环的性价比最高。
2、MRL 低维档诊断与 SID 量化:从连续表征到离散语义 ID。 当前使用 MRL-E 的嵌套维度列表[1024, 512, 256, 128],推理时截取前 128 维。前沿调研显示两个值得关注的点:一是 d<128 的极低维档存在退化风险(多篇工作独立证实),需要对各截断层做 neighbor-overlap 诊断,若发现退化,则移除对应维度档位,避免多尺度联合 loss 被最差档拖累。
二是更激进的方向:将连续 Embedding 量化成分层离散语义 ID(Semantic ID)[19]。SID 把 embedding 压成"分层的离散码字序列"(如 3 层码本)[20],既保留语义近邻结构,又能像 ID 一样查 Embedding 表、天然层级共享、对新品友好。SID 的潜在价值在于:它打通了语义表征和 ID 特征的壁垒,让大模型表征能以更原生的方式融入排序模型的特征交叉体系,而非仅通过 cosine 相似度分桶间接参与。
3、针对下挂场景重训表征模型。三期复用的是商家精排的表征模型,训练数据以商户样本为主。下挂样本在 Query 分布(更多商品意图词)和正负样本构成上与商户有显著差异,专项针对下挂场景训练一版表征模型,预期能进一步提升 Embedding 质量和覆盖率。同时,前面提到的负例质量提升和 MRL 诊断,可以一并在这版重训中落地。
4、Producer→Consumer 闭环:让排序信号回灌表征。当前的表征训练和下游排序是单向的——表征产出后通过 cosine 相似度喂给排序模型,但排序模型学到的场景感知相关性没有回流到表征训练。前沿工作 relevance_based_emb 提出了这条闭环的雏形:把下游排序的相关性判断作为蒸馏信号回灌到表征训练,让表征不仅语义准确,还对齐下游排序目标。这是 Producer(表征生产)与 Consumer(排序侧消费)协同的独有优势,有望进一步缩短离在线 Gap。
本文介绍了服务零售搜索排序团队在 2025 年 Q4 至 2026 年 Q2 期间,将 LLM 语义表征引入精排模型的三期实践。一期验证了可行性——用 64 维 cosine 相似度特征就带来了显著订单增量;二期系统性重构了表征生产全流程——从分类目标转向对比学习,从全参数微调转向 LoRA,构建了 query-POI-deal 三元表征体系;三期将成熟表征迁移到下挂精排——在解决覆盖率问题后,通过 PEPNet 门控注入和全域交叉统计特征的叠加,进一步拓展了收益边界。
三期迭代的主线可以概括为一个认知演进:从"用 LLM 生成一个语义特征"到"构建一套可迁移的表征生产体系"。一期的重心是验证"LLM 表征能不能用",二期是解决"怎么把表征做好",三期是探索"好的表征怎么跨场景复用"。每一期的技术决策都建立在前一期的短板分析之上,而非独立的技术选型。
从方法论角度,三期实践沉淀了一条可复用的表征工程路径:用对比学习目标(InfoNCE + Triplet)训练 LLM 表征模型,用 MRL-E 实现多尺度降维,用相似度分桶或 PEPNet 门控注入排序模型。这条路径的每个环节都有明确的工程 checklist——难负样本的质量决定表征上限,Prompt 精简化优于复杂指令,覆盖率验证是跨模块迁移的第一步,语义特征与统计特征应协同设计而非二选一。
注释
KDD(ACM SIGKDD Conference on Knowledge Discovery and Data Mining)是数据挖掘与知识发现领域最具影响力的国际顶级学术会议。KDD 以其严格的论文录用标准和深厚的学术影响力著称,是推动数据驱动研究与应用创新的重要平台。大会为学术界和工业界提供了交流前沿成果的高水平论坛,论文录用率通常在 15%-20% 左右,属于计算机领域的 CCF-A 类顶级会议。
本文精选了美团技术团队被 KDD 2026 收录的 8 篇论文进行分享,这些论文覆盖了推荐大模型、生成与奖励建模框架、智能体搜索、Transformer 框架、元泛化框架等技术领域。
🏆 此外,大众点评技术部还荣获了 2026 KDD Cup 复杂数据分析 Data Agents 国际竞赛的冠军、季军,本文介绍了团队比赛思路和解题策略。希望以上这些内容能够对大家有所帮助或启发。
论文下载:PDF

论文简介:工业推荐系统通常涉及多个场景,而现有的跨域(CDR)和多场景(MSR)方法往往需要大量资源且要求严格的输入对齐,限制了其可扩展性。该论文提出了MTFM(Meituan Foundation Model for Recommendation),一种基于Transformer的框架,旨在解决上述挑战。MTFM不预先对齐输入,而是将跨域数据转换为异质Token,以无对齐的方式捕捉多场景知识。为提升训练效率,MTFM引入了多场景用户级样本聚合机制,显著减少了总实例数量,大幅提升训练吞吐量;同时融合了Grouped-Query Attention和定制化的Hybrid Target Attention,有效降低了内存占用和计算复杂度。 此外,论文还实现了多项系统级优化,如kernel融合和消除CPU-GPU阻塞,进一步提升了训练和推理吞吐。在外卖等场景的离在线实验均验证了MTFM的有效性,证明了通过扩展模型容量和多场景训练数据可以实现显著的性能提升。基于MTFM,团队构建了服务于以上多个业务主场景的统一基座推荐大模型,替换各自的独立精排模型,并完成了全量。
论文下载:PDF

论文简介:本文提出CDRRM,一个对比驱动的评分准则生成与奖励建模框架,旨在提升LLM对齐中奖励模型的可靠性、可解释性与数据效率。传统奖励模型是“黑箱”且依赖昂贵标注;现有准则方法存在冗余与偏见。CDRRM采用“对比-聚合”流程:先对比好/差回答定位关键差异,再聚合为简洁的任务相关准则,指导评判模型。实验表明,CDRRM在三个基准上达最先进水平,缓解话痨、位置等偏见,且仅用3千样本让未微调模型超越全量微调基线,兼具高效与可解释性。
论文下载:PDF

论文简介:本文针对本地生活服务领域AI搜索的研究空白,构建LocalSearchBench评测基准。该基准涵盖国内 9 座城市、6 大服务品类,包含 900 道多跳问答任务,同时配套交互环境 LocalPlayground 与商户检索工具 LocalRAG。实验测评 16 款主流大语言推理模型后发现,当前模型在此类任务表现不佳,普遍存在信息完整性、可信度不足等问题。研究还剖析了模型工具调用、多跳推理等典型缺陷,为本地生活服务场景下智能体搜索的模型训练和基准测试提供了重要支撑。
论文下载:PDF

论文简介:针对联合广告拍卖场景中的算法无法同时满足匿名性和确定性分配的问题,导致实际应用中存在分配不公平和激励不兼容等问题,提出了JTransNet模型。匿名性要求拍卖结果仅依赖于竞标价值,而与参与者身份和顺序无关,确定性分配则保证同样的输入下分配结果唯一。JTransNet通过引入匿名性和确定性分配机制,结合可微分的NeuralSort排序方法,实现了端到端数据驱动的AMD自动化模型拍卖算法。该算法很好的解决了联合拍卖场景下多方出资的流量分配和扣费问题,在离线和在线实验中均显著提升了平台广告收益。JTransNet已在美团零售核心业务场景全量上线,促进了广告业务流量售卖的公平性与收益提升,同时为工业界大规模自动化模型拍卖机制算法设计提供了有效的解决方案。
论文下载:PDF

论文简介:在即时物流场景中,提单页面的预估到达时间(checkout page ETA)对提升用户满意度、优化调度策略和控制运营成本至关重要。在美团Keeta等国际化即时配送平台上,具有显著的跨域异质性,多域建模已成为核心需求。然而,现有方法面临三大挑战:一是无法泛化到完全未见过的新市场域,无法在冷启动阶段实现零样本预测;二是跨域特征空间不一致,新市场域由于缺乏历史数据积累导致离线统计特征结构性缺失;三是成熟域与冷启动域往往需要分别建模,阻碍了知识迁移并增加了维护成本。 为此,本文提出了UME(Unified Meta-generalization framework for ETA),一个统一元泛化框架。UME设计了统一双分支网络和基于超网络的元学习机制,通过域级知识和实例级上下文动态调制特征门控、专家注意力和最终预测,实现跨域关联建模和域内自适应。同时引入知识蒸馏策略弥合特征缺失带来的信息差距。该方法在离线实验与线上实验中均优于现有方法。
论文下载:PDF

论文简介:现代自动竞价系统需要在整体效果、广告主多样化目标和现实约束之间取得平衡,反映行业不断变化的需求。近年来,条件生成模型(如Transformer和扩散模型)能够根据广告主偏好直接生成竞价轨迹,为传统基于马尔可夫决策过程的方法提供了有前景的替代方案。但这些生成方法也面临诸如离线与在线环境分布偏移、动作空间探索有限以及需满足CPM和ROI等约束的挑战。为此,我们提出了GRAD,这是一种可扩展的自动竞价基础模型。GRAD通过动作混合专家模块实现多样化竞价行为探索,并结合因果Transformer进行约束优化。
论文下载:PDF

论文简介:在现代在线广告平台中,保证交付(GD)合约与实时竞价(RTB)拍卖共存并相互竞价。现有方法要么将GD与RTB的优化解耦,要么依赖启发式的优先级规则,因此无法在复杂的多坑位投放和曝光约束下,有效平衡短期收入最大化与长期合约交付目标。针对这些问题,我们提出了HMAF(分层多坑位分配框架),这是一个统一框架,旨在优化GD-RTB广告平台中的曝光分配。HMAF以“规划–校准–执行”范式为核心结构,将离线约束优化与在线决策相结合,统筹离线GD资源规划、动态校准GD与RTB的竞争强度,并在多坑位环境中做出实时的列表级排序决策。
论文下载:PDF

论文简介:生成式推荐在搜索、推荐、广告领域得到越来越广泛的应用,在用户体验和平台收入方面均取得了显著的提升。随着生成式推荐模型Scaling Dense的发展趋势,业界越来越倾向于基于PyTorch生态构建下一代推荐模型训练引擎,最大程度上复用LLM的发展红利。然而,PyTorch 生态在对大规模稀疏Embedding训练的支持上,仍有较大的提升空间。因此,我们基于PyTorch 生态提出了MTGenRec训练框架,统一「稀疏-稠密」训练能力,满足工业级生成式推荐模型训练需求。 具体来说,针对稀疏ID我们提出使用动态Hashtable替换静态表,解决ID动态上下线的问题,方便用户使用;为了提升训练效率,我们提出自动合表、ID去重、变长序列负载均衡等技术,针对推荐场景进行极致优化。此外我们还开发了断点续训、混合精度训练、梯度累积、算子融合等配套技术。大量实验结果显示相比TorchRec baseline,MTGenRec能够取得1.6倍~2.4倍的训练加速比,同时保证训练精度不变。从8卡扩展到128卡,MTGenRec也取得了近似线性的扩展效率。目前MTGenRec已在美团内部多个核心场景落地使用。
KDD Cup 是数据挖掘与知识发现领域全球公认的顶级赛事。在 2026 赛季的 DataAgents 赛道中,美团技术团队历时两个月,从全球参赛队伍中突围,最终摘得冠军与季军。
比赛考察的是模型在真实复杂数据场景下的理解与推理能力——多模态输入、非结构化文档、干扰信息识别,每一项都是当前 Agent 落地的硬骨头。

传统的 Data+AI 系统虽已在特定任务上取得显著进展,但端到端的分析流程仍高度依赖人类专家编排,成为制约数据分析可扩展性与适应性的主要瓶颈。为此,KDD Cup 2026 提出以「数据智能体(Data Agents)」破局——通过融合知识理解、推理与规划能力,自主完成任务拆解与规划、工具选择与调用、异构数据推理以及结果综合。复杂数据分析是其中的核心任务,主要挑战在于真实数据的「异构鸿沟」与推理链路的非线性复杂性。Data Agents智能体接收一份异构的多模态数据包(涵盖数据库、PDF 报告、JSON 数据、图表乃至视频等),并针对一个高层次的自然语言问题,自主编排包含并行分支、迭代循环与结果汇聚的复杂推理过程,最终给出准确答案,旨在推动构建真正自主的数据分析系统。

比赛中,队伍将点评「问点仔」建设过程中积累的 Agent Harness 能力迁移至赛题,利用业余时间构建了完整的 Agent 运行时,支持多类型数据文件的自主探索以及 SQL、Python 等分析工具的选择与执行。通过错误反馈、超时控制和自动重试等机制,提升智能体在长链路任务中的稳定性与容错能力。针对视频和非结构化文档等异构数据,还构建了多模态视频理解子智能体和非结构化文档 ETL 子智能体,进一步增强主智能体的数据提取、理解与综合分析能力。此次获奖验证了相关技术在复杂异构数据分析Agent场景中的有效性,也为后续持续提升「问点仔」智能化水平提供了技术积累。
目前,相关代码已在GitHub开源,后续我们还会通过技术博客分享更多的技术细节,敬请期待!
本篇博客是一篇科普文章,由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么,以及如何建立评测体系;其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验,是我们在两年实践过程中逐步打磨出来的认知。第三章重点介绍了龙虾/爱马仕这类长程Agent框架的出现对评测带来的变化。
本篇博客在美团内部发表之后获得了较多的关注,我们发现大家对Agent评测的热情非常高,因此我们决定将内部博客进行公开,想把这些经验分享给更多的同学,希望对大家有所启发或帮助。
评测的核心目的是为了回答 Agent 的好不好?以及到底哪里好,哪里不好? 从而为下一轮迭代指明方向。评测是Agent效果的“精密量具”。
这也是为什么 Agent 评测不能只停留在离线打榜,更不能只看某次 Demo 的表现。它必须服务于真实业务中的研发、上线、回归、优化和规模化落地。
而Agent评测的基石是观测,因此我们得出了Agent研发公式 —— 观测 + 评测 = 持续迭代
评测方法会随着 AI 形态变化而变化,大致经历了三个阶段:

传统机器学习更像在回答“算得准不准”。 大模型评测开始回答“模型能力强不强”。 而 Agent 评测真正要回答的是:
当模型被放进一个真实系统里,和 Prompt、Skill、工具链、记忆、状态管理、业务流程耦合在一起后,它能不能稳定交付好的结果。
这意味着 Agent 的评测对象已经不再是单一模型,而是一个“模型 + 系统 + 工具 + 流程”的复杂系统。
在真实场景中,两个 Agent 可能最终都“做对了”,但工程价值完全不同:
如果只看最终答案,这两者会被误判为同一水平;但从规模化、成本优化、用户体验的角度看,差别非常大。
因此,Agent 评测至少需要覆盖四层内容:
从这个意义上讲,自2023年GPT爆火以来,Agent发展从ChatBot形态快速发展至ClaudCode、OpenClaw这样的多功能长程Agent,Agent能力日渐强大,Agent评测正在从“答案评测”走向“行为评测”。
有一个朴素的认知:Agent 属于广义的 SaaS 层,大模型赋予Agent泛化能力但也带出随机性的问题,而用户仍旧期望得到一个稳定可靠的智能体。为了弥合“随机性”与“可靠性”之间的鸿沟,我们必须回归工程视角看待Agent —— 看不见的问题,几乎不可能被稳定解决。
Agent 的一次执行通常包含如下链路:

只要其中任意一层出问题,最终效果都可能劣化。为了结果稳定,我们需要过程稳定。但如果日志系统只能看到“用户说了什么”和“最后回复了什么”,就几乎无法判断问题根因。正是基于“我想看Case却发现没打日志”这个朴素的问题,工业界发展出了 Trace 系统,将黑盒内部的逻辑推理过程进行全路径的披露,将所有影响模型输出的输入信息都记录下来。
对 Agent 的每一个“隐形动作”进行精准观测,是实现从“概率性生成”向“工业级可靠性”跨越的必由之路。
经过前文的论述,我们知道Agent评测本质是在回答好不好,为迭代指明方向。而Agent评测本身既要关注结果(Response)也要关注过程(Trace或者叫做Trajectory)。
有的同学会好奇,为什么一定要“搭桥”?这是因为Agent评测体系必须追求业务价值与评测指标之间的解释性。而Agent 评测的难点之一,是模型能力指标和业务结果指标之间有天然鸿沟。

这两类指标不能直接映射,中间必须有一层面向任务系统的桥梁指标。我们提供一种分层思路如下:

以 AI 搜索为例,业务可能关心DAU、留存和点击;搜索系统本身关心召回率和点击率;Agent 层则关心意图识别是否准确、检索是否有效、结果整合是否可信。
只有把这些层次串起来,才能真正回答“为什么业务指标变差”以及“模型能力提升为什么没有带来业务收益”。这件事必须依赖真正懂业务流程的人来共同建立指标体系。
经过第一章的介绍,我们知道,Agent的核心目标就是要稳定地交付好的结果。行业内 Agent 评测大量借鉴了大模型评测的方法论,总体上可以拆成客观评测和主观评测:

因此更现实的做法通常是:
“好不好”是一个主观问题,主观的标准需要对齐,否则我们不能确定某次迭代之后,到底是指标的抖动带来的提升还是真实的效果提升。
在评测实践中,真正困难的不是“没有人会评”,而是“不同的人评得不一样,机器和人评得也不一样”。在过去一年,我们图灵团队深度BP业务方的过程中,我们发现多个团队相继踩入了相同的坑。
图灵评测积累的关键认知可以概括为“人人对齐和人机对齐”,具体如下:

具体如何进行对齐呢?最佳实践是把模糊指标下钻成更细的评测Rubric(或者叫评测维度:学界关于评测维度dimension和评测规则rubric的说法尚未统一,我们这里与开源项目Arize AI对齐),再把每个Rubric尽可能二元化。具体如下:
这种拆解法的价值在于:从“主观的模糊感受”转向“可判断的事实依据”,用下钻降低模糊度,从而降低人与人之间、人与机器之间的分歧。应用这套方法,数字站长的人机一致率可以达到99%。Beam以图灵的二元化方案改造评测体系,人机一致率从62%提升到92%。
下面我们分享两个案例。
案例一:如何评价初中生作文的好坏?(满分40分)

案例二:以骑手外呼场景模型回复是否“口语化”举例
经典错误示范 —— 请判断大模型的回答是否口语化,并按照0到10分打分。
下钻与二元化之后的改进版:
补充:标注和评测的关系是什么?
其中,标注是一种动作,而评测是一套目标导向的判断流程。机器预标注可以帮助人工提效,但只有在人机一致率保障才能称为自动化评测,否则只是机器标注。
从执行链路看,Agent 评测可以被拆成五个关键环节,
这5个环节与线上AB、持续观测共同构成了Agent迭代的数据飞轮。
绝大部分新上手Agent评测团队都有一个误区 —— 多方调研总结设计一个复杂精妙的评测指标体系,而越复杂的指标越难以执行和对齐。
而Agent评测是一门实践科学。起步阶段“让数据飞轮高效运转起来”的意义远大于“设计一个复杂精妙的评测体系”。评测体系的建立不是一蹴而就的,而是依靠 Good Case 和 Bad Case 喂养的。
因此 ,Agent 评测指标体系的搭建最佳实践路径如下:
其中,Bad Case 的价值往往更高,因为它最容易暴露能力边界和系统短板;而 Good Case 的作用则是帮助团队定义高质量完成的范式。
一个成熟的评测团队,核心能力不是一开始就搭出完美系统,而是能把线上问题、失败样本、模糊反馈不断转化成结构化评测资产。我们通过Bad Case和Good Case修正评测体系的目标,逐步修正“独裁者”与真实目标之间的负面偏差。例如履约数字站长业务,项目启动之处只有20多个评测指标,而经历1年时间推全之后,我们扩展到了近200个指标。
从GPT 3.5发布至今,虽然基座能力发生了天翻地覆的变化,但是模型能力终究不是万能的。在过去三年的Agent实践中,我们遇到过大量脱离实际的“许愿式”需求。我们要知道模型是训练出来的,模型本身拟合了Token的概率分布,即便在大规模参数下会产生能力的“涌现”,但模型能力的提升依旧强依赖语料的输入,尤其是高质量语料的输入。无论是早期的RLHF,还是如今的DPO、GRPO等算法,虽然训练架构在不断简化,但对高质量核心数据的依赖从未改变。
例如字节专门设立了众包专家标注平台 Xpert,用于生产地理、代码、法律、医学等专业领域的高质量数据,以此支撑豆包基座模型的迭代训练。基座模型能力的提升,大家的直观感受就是它在一个又一个垂直领域的表现越来越好。
因此,当我们在特定垂域面临业务知识语料匮乏(或公网无公开高质数据)的挑战时,通过引入行业专家的知识输入来补足模型/Agent的能力,就成了破局的关键——尤其是在项目的冷启动阶段。

呼应前文,评测的目的是回答“Agent好不好”,那么谁来定义“好不好”呢?靠最懂业务最有Sense的行业专家。
这个章节讲述的是图灵评测从履约的项目出发,又经过这1年多BP公司各个业务方的过程中沉淀的核心方法论。
FAQ
Q1:“独裁者”必须是1个人吗,还是1个团队共同遵循一套评测规范即可?
首先一个团队需要遵循同一套评测体系。独裁者的作用多方征求意见并整合评测体系,当项目方观念无法对齐的时候,由独裁者拍板定论,避免评测体系分化带来项目方各自为政以及内部拉扯带来的损耗。
Q2:评测体系依赖“独裁者”,存不存在风险?
我们要认清一个事实,评测体系是不断演进的。从业务冷启动到扩量再到全量,这个过程中用户从愿意尝鲜的AI爱好者扩展到全部用户,用户画像会发生明显的偏移。这导致评测目标需要随着业务的扩量不断地发生调整。独裁者的价值更多的体现在拉齐标准,评测目标更多的是由真实的业务场景中BadCase/Good Case修正并驱动的。当然,我们需要在评测标准建立之初选出最懂业务的人来制定评测体系。
Q3:冷启动阶段一定要设立种子评测集吗?能不能直接小流量开灰上线,直接收集Good Case和Bad Case来驱动评测呢?
冷启动阶段是否必须设立种子评测集,本质上是一个风险与成本的Trade-Off。
为什么建议设立种子集:大模型具有随机性,Corner Case 可能会导致Agent体验剧烈偏移。因此,需要通过回测保证Agent基线能力,不断融入Good Case和Bad Case来拓宽Agent的能力边界。
关于小流量开灰的策略:如果业务场景容错率高,或者构建高质量种子集的成本远超线上试错带来的负面反馈,可以尝试小流量上线收集线上case。
推荐落地方案:人工生产少量评测集后,AI辅助生成或扩写,以较低成本完成冷启动的种子评测集构建。
Q4:我们邀请的行业专家对“好”的定义不一致应该怎么办?
答:最朴素且有效的方法,邀请一批行业专家定义“好”的标准,从中抽取共性的部分建设评测体系。例如邀请金牌销售来定义优秀的销售SOP。
那么非共性的部分就没有价值了吗?并非如此。对于专家意见不一致的部分,往往意味着业务本身存在多种优秀策略。我们可以将这些分歧转化为 Agent 的不同风格或策略分支(例如:AI电销中,老练激进派 vs 细水长流派),并允许在不同的测试集(Benchmark)中独立评测。这些分歧点非但不是噪声,反而会成为 Agent 未来走向精细化迭代、覆盖更多长尾场景的重要养分。
2023年GPT爆火,2024年工作流出现,去年 Claude Code发布,再到今年的龙虾热、爱马仕热,长程Agent逐渐进入了大众视野。Agent Harness也全面进入长程Agent时代。
长程Agent(Long-horizon Agent)与短程Agent的区别,在于它如何处理“时间跨度带来的复杂性”:

这些差异会为观测评测带来怎样的变化呢?
短程Agent时代的评测对象相对简单。ChatAgent 时代的典型输入输出形态是:Query -> Answer。
这类场景的共同特点是:Agent 更多是在“回答问题”,进行少量的系统操作,而不是“进入操作系统执行任务”。典型应用场景,例如AI搜索、客服机器人。此类Agent评测重点通常落在回答本身,例如:

在过去1年的发展中图灵形成了成熟的解决方案,包括人工评测、机器评测,部分案例如下:

3.2.1 长程Agent带来评测范式变化
长程 Agent 解决的不是“回答一个问题”,而是“完成一个复杂任务”。它通常需要:
让我们回顾一下观测和评测的目标,带着这个目标去看长程Agent

3.2.2 Skill评测
在讲Skill评测之前,我们先分享一下我们关于26年春节后这一轮龙虾/Skill热潮的调研。
谁在提出龙虾和Skill的评测需求(2月至今龙虾/Skill热潮的用户画像)?
总结起来目前龙虾和Skill相关需求主要 广义的运营提效 场景,大致可以分成三类:

用户规模正在从少量专业角色扩展到更广人群
这会带来一个直接结论:
未来需要评测的人,不只是一小撮产运研同学,而可能是每一个会创建、修改、接入 Skill 的人。
这对评测系统提出了新的要求:
当前的本质痛点
本质在于 —— 大家不知道怎样写好 Skill,也缺乏对 Skill 全生命周期进行评测的工具。
为了方便大家理解,我们将Skill全生命周期拆解如下:

综上,Skill评测的痛点总体可以拆解成三个方面:

面向Task的评测
2026年1月9号,Anthropic发表了一篇博客揭秘AI Agent评估,在这篇博客中首次提到了面向Task的长程Agent评测。文中对Task,定义为“具有明确输入和成功标准的单个测试”。
我们综合了Anthropic以及开源软件对Task的定义,简化如下。

prompt定义了我们的问题/诉求,expeted behavior定义了我们预期Agent达成的行为,当我们在正式或测试环境中向Agent发送promt,通过trace获取到长程Agent真实的执行路径,就可以得到(prompt - expeted_behavior - trace)三元组,类似于短程Agent的(query - ground_truth - answer),即可进行评测。
3.2.3 长程Agent评测与短程Agent评测的差异
可以把两者的差异总结如下:

最本质的变化是:
ChatAgent 评测关心“说得好不好”,长程 Agent 评测关心“事情做成没有,以及是怎么做成的”。
3.2.4 人评主导走向机评主导
ChatAgent 时代常见流程是:核心评测员对齐 -> 外包对齐 -> 机评对齐
而在长程 Agent 场景下,这条链路有机会被明显缩短,甚至可以跳过外包对齐,直接进入:核心评测员对齐 -> 机评对齐 -> 规模化扩展
原因主要有三点:
这并不意味着人工不重要,而是意味着:
换句话说,AI 评测真正要放大的,不是“机器打分”本身,而是核心评测员的判断标准。
3.2.5 长程Agent评测基建至少应该具备哪些能力
如果未来要支撑公司内大规模 Agent 和 Skill 生态,评测基础设施至少应包含以下能力:
如果缺少这些能力,评测就容易停留在“单次分析”和“项目制支持”层面,无法真正成为生产系统的一部分。
综合来看,随着大模型能力的增强以及Agent Harness的持续演进,Agent 评测的演进可以概括为两句话:
第一,评测对象变了
过去评测的是“回答”,现在评测的是“任务系统”。
因此我们关心的不再只是输出内容本身,而是完整执行链路中的能力、稳定性、效率与风险。
第二,评测方法变了
过去主流是 Query -> Answer 的文本质量评测,现在逐步转向 Prompt -> Expected Behavior 的行为评测。
标准答案不再总是唯一,过程质量、任务完成度和轨迹质量成为新的核心对象。
因此,未来真正重要的,不只是能不能做几次评测,而是能不能建设出一套:看得见问题、说得清标准、跑得动规模、接得上流程、带得动迭代的 Agent 评测体系。
本月,美团 LongCat 2.0 已正式开源,总参数 1.6T,平均激活约 48B,动态范围 33B 到 56B,原生支持 1M 超长上下文。这是首个在五万张国产算力卡上完成全流程训练与推理的万亿参数模型。开源只是第一步,让 LongCat 2.0 在真实的工作任务中成为可靠的“工作伙伴”,才是真正的考验。
现在,搭载 LongCat 2.0 的美团全场景 AI Agent 平台 CatPaw 正式上线,将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。
不仅如此,依托美团十余年深耕本地生活的行业积累,CatPaw 将商家经营、服务履约与消费决策的深度认知融入其中,助力企业构建 AI 数字员工、推进业务智能化升级。
目前,CatPaw 已在美团内部大规模落地:累计覆盖 9 万员工、搭建 Agent 3 万个,并在多个真实业务场景中完成验证。
提供独立的移动端 App 与 PC 客户端,双端任务实时同步、无缝协作。移动端支持随时发起任务、查看进度与远程确认关键决策;PC 端专注本地深度执行,具备文件操作、浏览器控制与终端命令等完整能力。
云端模式支持 7 × 24 小时不间断运行,即使本地设备关机或断网也不受影响。长程任务与定时任务于云端持续运转,完成后随时打开手机或电脑即可查看成果。

在全场景通用 AI Agent 能力的基础上,CatPaw 进一步融入了美团在本地生活领域的全链路行业认知。从门店经营、评价体系、营销转化到履约配送,这些深度积累已被封装为即装即用的专家与技能,覆盖门店评价诊断与优化、商品文案生成、营销物料设计评估、活动策划、经营数据分析等场景。
CatPaw 既是人人可用的全能 AI 助手,也是真正懂本地生活生意的智能搭档。

CatPaw 支持 AI 专家,每位专家集成多项技能与子代理,高效完成特定领域的复杂任务。从专家广场一键安装即可使用,也可通过对话将自己的工作方式快速封装为专属专家,团队共享复用。
平台内置丰富的技能库,开箱即用。内嵌浏览器还支持操作过程一键录制,将日常高频流程自动生成专属技能,让个人与团队经验沉淀为可复用的数字化资产。
支持跨会话长期记忆,自动记忆用户的个性化偏好、操作习惯与历史上下文,跨设备、跨对话保持连续理解,越用越懂你。

只需明确最终目标,Agent 便会自主规划步骤并在授权范围内深度执行:读取文件、操作浏览器、运行终端命令,直接交付 Excel、可视化报告或代码等可用成果。
面对跨领域的复杂任务,系统动态进行任务拆解,调度多个具备专属工具的 Agent 并发处理,各 Agent 在独立环境中互不干扰,进度实时可见,结果自动汇总。

CatPaw Managed Agents 是企业级 AI Agent 开发与托管平台,提供开箱即用的工程底座,无需从零搭建底层基建,即可快速构建、部署与管理专属 Agent。
数字员工是运行在飞书、企微等 IM 中的 AI 虚拟同事,@ 即可唤醒使用。平台预置多种角色模板,扫码即用;美团在本地生活领域的长期积累也已沉淀为专属模板,不只是通用的聊天机器人,而是理解业务的行业 AI 助手。
同时支持通过 AI 对话描述需求,快速生成专属数字员工。从 Agent 创建到环境部署、会话初始化,全程自动完成,无需手动配置。
提示词、知识库、凭证、工具均支持在线管理,团队可按业务场景灵活搭建。

Agent 运行环境严格隔离,租户间数据互不可见。凭证集中托管,确保 Agent 全程零接触敏感资产。
支持分级权限管控与私有化部署,全面满足企业合规与安全审计要求。

支持按需配置运行环境,一键托管上线,资源动态扩缩。
沙箱环境轻量隔离,百毫秒级冷启动,闲时自动释放,兼顾响应速度与成本。

提供统一的运维管理界面,会话记录完整留存可追溯,支持在线调试实时排查问题,模型调用量与消耗清晰可见。
多维度数据统计与分析,帮助团队持续评估 Agent 表现、优化运行效果。

在全场景 AI 能力之上,CatPaw 提供组织级的管理与管控能力,满足商家**规模化落地 AI **的管理需求。
CatPaw 提供统一管理后台,支持团队账号体系。团队成员与权限集中管理,用量明细与消耗实时可查,成本清晰可控。AI 专家和技能支持按团队或角色集中配置与精准下发,一线员工开箱即用,AI 能力快速转化为实际生产力。
此外,CatPaw 还提供与美团业态深度关联的专属专家与技能,覆盖外卖、服务零售、医药健康等多个行业。以服务零售为例,美团商家运营专家整合了经营数据分析、评价管理、门店装修等核心场景,帮助商家实现智能化运营。
CatPaw 将持续深入行业场景,让 AI Agent 真正成为驱动经营增长的数字化伙伴。更多能力陆续开放中,诚邀美团合作商家抢先体验。
过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。

BrowseComp 的题目由人工设计,局限在于只能基于标注者已知的实体和关系构思,无法站在全局知识网络视角判断:哪些条件真的难检索?哪些约束的候选空间足够大?正是这种局限,让我们开始思考另一种可能性:能不能让机器自己来出题?
美团 LongCat 团队在最新论文中提出的 LoHoSearch 基准,就是把这种可能性变成了现实。
机器出题的前提,是让机器拥有全局视野。整个构建流程可以分为四个环节:建图 → 控制难度 → 质量把关 → 数据概览。下面逐一展开。
LoHoSearch 的第一步,是从完整的英文维基百科出发搭建一张大规模知识图谱:
这张图谱为后续在全局视角下挑选"难题"提供了基础。

有了图谱之后,下一个问题是:什么样的题目才算"难"?LoHoSearch 从两个维度来定义难度。
决定搜索难度的核心有两个维度,而它们恰恰是人工出题最难把控的:
针对这两个维度,LoHoSearch 设计了两种子图结构:

子图采样完成后,还需要转换为可阅读的自然语言题目。整个转换与验证流程分为三层:
经过三层筛选,自动化流程的整体质量表现如下:75.5% 的题目直接通过人工复核,22.3% 经标注员微调后接受,仅有 2.2% 因严重问题被丢弃。
LoHoSearch 最终收录 544 道 经人工核验的题目。对比树结构和图结构可以看出,图结构子图明显更稠密——节点更多、边数接近前者的两倍,这正对应它更高的结构复杂度。题目内容覆盖音乐、地理与地点、影视、体育等 11 个主题领域。



最强模型 GPT-5.5 准确率仅 34.74%,DeepSeek-V4-Pro、Claude-Opus-4.6 和 Kimi-K2.6 集中在 15.53%–15.99%,其余模型均低于 14%。这与它们在 BrowseComp 上 80% 以上的表现形成鲜明对照——LoHoSearch 对当前最先进搜索智能体构成了实质挑战。
用 DeepSeek-V4-Flash 作为探针对比两个基准:同一模型在 BrowseComp 上准确率 58.84%,在 LoHoSearch 上仅 10.02%。

解一道 LoHoSearch 题目,平均工具调用从 35 次增至 61 次(+74%),中位数从 26 次升至 59 次。图结构题目准确率仅 8.01%,远低于树结构的 11.89%,印证了结构复杂度是独立于搜索空间之外的额外难度来源。
对 DeepSeek-V4-Flash 采样 16 个独立回答,结果如图 5 所示。

pass@N 从 N=1 的 9.3% 升至 N=16 的 38.3%,重复采样收益可观,但 38.3% 仍处低位。尝试 16 次仍有六成以上题目无法攻克。三种聚合策略中 best-of-N 表现最优(24.6%),远低于 pass@16 上界,说明模型在答案置信度校准上存在明显不足。
以标准 ReAct 为基线,测试 Summary 和 Discard-all 两种策略,并加入 Verify 模块。

表现最佳的组合(Discard-all + Verify)将成绩从 10.02% 提至 16.82%,绝对提升仅 6.8 个百分点,而同一套策略在 BrowseComp 上可带来 14 个百分点的增益。收益收窄的原因在于 LoHoSearch 需要更长的推理链,简单的轨迹压缩或重启无法解决长程搜索中的信息丢失问题——这使其成为下一代上下文管理技术更有价值的试验场。
对比两个基准中"隐藏实体"的特征可以发现:

其一,BrowseComp 的隐藏实体流行度明显更高,人工出题难以精确控制实体知名度,导致实体偏易。
其二,即便将流行度控制在同一水平,LoHoSearch 的关系搜索空间仍显著更大,实体推断难度远高于 BrowseComp。
这说明人工构建存在系统性局限,知识图谱是系统化构造高难度题目不可或缺的基础。
LoHoSearch 的价值体现在三项具体贡献上:
LoHoSearch 已全面开源,欢迎各大模型前来接受"长程搜索"大考。
假如你出生在一片未知的森林,太阳即将下山,饥肠辘辘,前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。
此时如果你按下暂停,把截图发给所有顶级的多模态大模型,它们都能完美回答你:“黄昏、有怪物,面临威胁。”
我们发现,多模态大模型能看懂图像、解析视频、在复杂场景里推理,然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么?
为了深入探索,美团 LongCat 团队构建了MineExplorer——首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。
MineExplorer 核心看点:
MineExplorer 不再是简单的看图问答,而是围绕一系列创新,构建了一个前所未有的评测体系。

创新点一:构建一个具备完整物理规则、会动态演化的世界
MineExplorer不是让模型看一张 Minecraft 截图做选择题,模型面对的是一个实时运行的3D沙盒世界。在评测中,每个任务实例会运行1800个环境步,每步执行 0.1 秒,对应一段3分钟的连续交互视频。也就是说在这3分钟时间里,环境一直在变:模型每做一个动作,世界状态就更新一次,它必须根据最新的画面不断调整策略。
创新点二:隐藏前置条件的长程多跳任务
这是 MineExplorer 最核心的设计,我们把任务按「跳数(hop)」分级,代表完成最终目标需要经过的隐藏前置步骤数量:
我们用一个数学化的方式来刻画这种结构。每个复合任务被定义为一个四元组 τ = (q, s₀, Gτ, Mτ):q 是自然语言指令,s₀ 是初始状态,Gτ 是任务之间的依赖图(DAG),Mτ 是规则化的里程碑检查器。关键在于:**指令 q 并不会枚举依赖图里的所有节点,智能体必须自己从环境里推断出隐藏的前置任务。**一个任务越难,意味着它需要越多样的能力、包含越多隐藏前置、依赖链越深。

创新点三:知识解耦——我们测的是「通用探索」,不是「背 Minecraft Wiki」
这是 MineExplorer 区别于以往所有 Minecraft 评测基准的一个关键设计。我们的做法是主动把游戏专有知识剥离掉。对每一个原子任务,我们用LLM裁判判断其主要依赖的是通用世界常识,还是Minecraft专有机制,并过滤掉后者。换句话说:我们测的不是「AI 会不会玩 Minecraft」,而是「AI 能不能在一个动态物理世界里自主探索」。

构建高质量的长程任务基准本身就是难题。我们的解法是让一组各有分工的 AI 协作来造题。MineExplorer 用一个多智能体协作流程,五个专业 Agent 在一个群聊里协作,由一个 orchestrator 控制发言顺序:

整个流程分初始化和辩论(debate)两个阶段,先生成初稿,再由专家和验证器找出问题并修订。
如下表所示,人工评估结果显示,多智能体流程把有效率拉高了约 30 个百分点,质量分提升约 0.5 分,在最难的4-hop任务上优势尤其明显。最终,我们保留了 813 个通过人工验证的高质量复合任务实例。

MineExplorer 借鉴 ReAct 范式,把开放世界探索拆解成三大能力维度,共 14 项细粒度能力:
如图所示,最终的基准在三大维度上都有充足的覆盖,其中空间感知、移动、采集等基础能力出现频率最高,常识推理、因果推理也占了相当比例。

MineExplorer不仅定义了考题,更给出了18个顶级模型的真实分数。如下表所示,这是横跨 Claude、GPT、Gemini 等八大家族的模型在整体任务成功率(TSR)上的排行榜。

我们发现,即便是表现最好的 Claude-Opus-4.6,整体成功率也只有 41 分。
| 洞察一:单跳尚可,多跳崩盘——问题就在隐藏前置条件
如图所示,最强模型Claude-Opus-4.6的表现,从1跳任务的77分,一路下滑到4跳任务的12分。每增加一层隐藏的前置依赖,模型就掉一个台阶。


| 洞察二:会看,但不会想 —— 感知强于推理
在几乎所有被测模型上,我们都观察到同一个规律:感知分数 > 行动分数 > 推理分数。如下图所示,以Claude-Opus-4.6为例,其整体感知分61.91,推理分54.71。瓶颈不在于看不见,而在于看懂了却无法串联成有效策略。

| 洞察三:近60%的失败原因,都是因为走不到目标
我们对 Claude-Opus-4.6 的失败案例进行了归因分析。如下图所示,导航失败是最大的错误来源,占比近 60%。

| 洞察四:给它更多步数、更多记忆,都不是解药
我们进一步做了消融实验,发现模型失败并非因为资源不足。


核心结论:瓶颈不在资源,而在模型没法把已有的信息和当前世界状态对齐。
MineExplorer 揭示了一个被乐观情绪掩盖的能力断层:当前的多模态大模型,已经具备了不错的感知力,但严重缺乏在动态世界中持续行动的探索力。
这对正在快速升温的具身智能赛道有几个直接的启示:
我们不是要给具身智能泼冷水。恰恰相反,把瓶颈定位清楚,比盲目乐观更有价值。MineExplorer提供的,正是这样一条诚实、可量化的能力基线。
看得见世界,不代表能探索世界。在一个会变化的世界里持续推理、持续行动——这才是AI走向真实世界,必须先跨过的那道门槛。MineExplorer 已全面开源,欢迎各大模型前来挑战开放世界。
🚀 开源链接