姚顺雨团队最新成果:从 Context 探索语言模型的范式转变
发布时间:2026-02-03 浏览量:242
“模型想要迈向高价值应用,核心瓶颈就在于能否用好 Context。”
2月3日,腾讯混元官网技术博客(Tencent HY Research)正式上线并发表了一篇名为《从 Context 学习,远比我们想象的要难》的文章,系统的介绍了腾讯混元团队联合复旦大学的一项新研究。
这是姚顺雨加入腾讯担任首席AI科学家后带领团队首次发布研究成果,也是腾讯混元技术博客首次公开。这一博客的推出,旨在分享腾讯混元研究员在前沿技术研究和实践中的探索与经验,呈现创新思路与技术洞察。
详情见:
项目主页:www.clbench.com
我们需要 AI 成为“context 学习者”(Context learners)
过去几年,大语言模型的进化速度快得令人惊叹。如今的前沿模型,已经是顶级的“做题家”:它们能解开奥数级别的难题,能推演复杂的编程逻辑,甚至能通过那些人类需要苦读数年才能拿下的专业资格考试。
然而,这些耀眼的成绩单可能掩盖了一个真相:能在考场拿满分的学生,未必能胜任真实世界的工作。
回看我们人类的日常工作:开发者扫过从未见过的工具文档,就能立刻开始调试代码;玩家拿起新游戏的规则书,在实战中边玩边学;科学家从复杂的实验日志中筛选数据,推导出新的结论和定律。我们发现在这些场景中,人类并不只依赖多年前学到的“死知识”,而是在实时地从眼前的 context 中学习。

三个人类日常生活和工作场景的例子。这三个例子分别为:(1) 面对 SkyNet 无人机 SDK 文档 (~70K 字),将自然语言所表达的飞行请求转成安全、合规的 SDK 伪代码; (2) 直接上手玩一款游戏:给定一款新游戏的完整规则 (~15K 字),分析隐藏房间场景并给出可能结果;(3) 分析300 份原始实验日志,验证数据、推导关系式并估计共振常数。
然而,今天的语言模型并非如此。它们主要依赖“参数化知识”,即在预训练阶段被压缩进模型权重里的静态记忆。在推理时,模型更多是在调用这些封存的内部知识,而不是主动从当前输入的新信息中汲取营养。
这揭示了当前模型的训练范式和在真实场景中应用之间是不匹配的:我们优化出的模型擅长对自己“已知”的事物进行推理,但用户需要的,却是让模型解决那些依赖于杂乱、动态变化的 context 的任务。
简而言之:我们造出了依赖“过去”的参数推理者,但世界需要的是能吸收“当下”环境的 context 学习者。要弥合这一差距,我们必须从根本上改变模型的优化方向。
语言模型的范式转变。
CL-bench: 衡量模型的 context 学习能力
为了衡量现有模型距离真正的“ context 学习者”还有多远,我们构建了 CL-bench。这是一个专门评测语言模型能否从 context 中学习新知识并正确应用的基准。
CL-bench 包含由资深领域专家精心制作的 500 个复杂 context 、1,899 个任务和 31,607 个验证标准。CL-bench只包含一个简单但苛刻的要求:解决每个任务要求模型必须从 context 中学习到模型预训练中不存在的新知识,并正确应用。
模型需要学习的知识非常广泛。它包括新的领域知识、不熟悉的规则系统、复杂的产品工作流,甚至是必须从实验数据中推导归纳出的定律或结论。
所有这些知识要么是由领域专家完全新构建的,要么是取自那些不太可能出现在当前前沿模型训练数据中的小众、长尾来源。因此,模型无法通过回忆静态的参数化知识来解决任务,都要求模型从提供的 context 进行学习并应用。
具体来说,CL-bench 涵盖了四种广泛的现实世界 context 学习场景:

CL-bench 的 context 分类体系。
领域知识推理: context 中提供特定的领域知识(例如 虚构的法律体系、创新的金融工具或小众专业知识)。模型需要利用这些知识来推理并解决具体问题。
规则系统应用: context 中提供新定义的正式系统(例如 新的游戏机制、数学形式体系、编程语法或技术标准)。模型必须理解并应用这些规则来执行任务。
程序性任务执行: context 中提供复杂的过程系统(例如 工作流、产品手册和操作指南)。模型必须理解并应用这些程序性信息来完成任务。
经验发现与模拟: context 中提供复杂系统内的实验数据、观测记录或模拟环境。与前几类涉及演绎推理不同,这一类专注于归纳推理,也是最具挑战性的。模型必须从数据中发现潜在的定律或结论,并应用它们来解决任务。
CL-bench 示例。解决这些任务要求语言模型从提供的 context 中学习。图中这四个案例分别是:(1) 在一部长达 2.3 万字、刚刚生效的新法律下判一起真实纠纷;(2) 基于一门新设计的教育编程语言规范,实现一个带有时间条件终止的周期性程序;(3) 在一套从未见过的编程框架中执行代码;(4) 在给定技术规格和长期环境政策情景的条件下,模拟关键技术金属的可持续全球供应。更多例子详见我们的数据仓库。
这些类别包含了大部分现实世界工作中常见的演绎推理和归纳推理任务,能充分衡量模型的 context 学习能力。
关于 CL-bench 的更多细节,请参阅我们的论文 CL-bench。


