杂谈:聊聊 Jev 与 Laya 的非生成式决策机制
Transformer 提出至今,核心骨架基本定型。业界的迭代重心长期集中在输入编码与预训练目标,而输出端始终被自回归生成所主导。2026 年 9 月,输出机制的改造迎来突破。9 2026-9-22 16:11:8 Author: www.cnpanda.net(查看原文) 阅读量:6 收藏

Transformer 提出至今,核心骨架基本定型。业界的迭代重心长期集中在输入编码与预训练目标,而输出端始终被自回归生成所主导。

2026 年 9 月,输出机制的改造迎来突破。9 月 15 日,TypeSafe AI 结束隐身状态,发布闭源模型 Jev,同时宣布完成 DCVC 领投的 4000 万美元种子轮 [1];9 月 18 日,Convai Innovations 的 Nandakishor Mukkunnoth 开源了 Laya 模型家族,公开全部权重与架构细节 [2]。这类模型保留了对自然语言的理解能力,但完全不做自回归的逐字生成,输入处理完毕后直接输出概率分布,充当纯粹的决策器。


一、架构演变与 Decoder-only 的胜出

2017 年最初的 Transformer [3] 包含编码器(Encoder)和解码器(Decoder),设计目标是机器翻译。它的突破是用自注意力机制取代循环神经网络。

自注意力(Self-Attention):序列中每个 token 都生成 Query、Key、Value 三个向量,用自己的 Query 与所有位置的 Key 做点积得到权重,再对 Value 加权求和。关键性质是所有位置可以并行计算,不像 RNN 必须按时间步串行推进。

注意力掩码(Attention Mask):在算完注意力分数、做 Softmax 之前,把不允许看到的位置置为负无穷。它决定了每个 token 能"看见"序列中的哪些位置,是区分三种架构的根本机制。

这套结构随后分化出三种形态:

  • BERT [4] 代表的 Encoder-only,双向注意力,适合文本分类、信息检索、内容审核;
  • T5 [5] 代表的 Encoder-Decoder,适合翻译、摘要等序列映射;
  • GPT [6] 代表的 Decoder-only,因果注意力,核心是自回归预测下一个词。

三者的本质差异,就在注意力掩码控制的可见范围,以及训练时的损失计算方式。

三种 Transformer 架构的注意力掩码对比
三种 Transformer 架构的注意力掩码对比

在通用大语言模型领域,Decoder-only 最终成为主流,原因是工程与训练层面的几个叠加优势,这一点在 BigScience 的架构与预训练目标对比实验中有系统评测 [7]

训练信号密度。自回归模型中序列里每一个 token 都参与损失计算;而掩码语言模型只对被遮蔽的部分计损,BERT 原始设置下只遮蔽约 15% 的 token,同样的语料能提供的梯度信号少得多。

接口的统一性。问答、代码编写、推理、多轮对话都可以归结为"继续生成文本",不需要为每类任务设计不同的输出头。

KV Cache 友好。因果注意力保证了已生成 token 的表征不会被后续 token 改写,因此可以缓存复用。

KV Cache:注意力计算需要历史所有位置的 Key 和 Value。因果掩码下,第 n 个 token 的 K/V 与后面的内容无关,算一次就能存下来,生成第 n+1 个 token 时直接读缓存,把每步的复杂度从 O(n²) 降到 O(n)。双向注意力做不到这件事,因为新增一个 token 会改变前面所有 token 的表征。这也是 Encoder-only 模型天然不适合做长文本生成的原因之一。


二、自回归带来的延迟瓶颈

大模型的推理过程分为两个阶段。

预填充(Prefill):整段提示词被并行送入计算,一次前向传播建立起对输入的完整内部表征,并生成对应的 KV Cache。这个阶段是计算密集型(compute-bound),GPU 利用率高。

解码(Decode):模型开始逐个生成 token。每产生一个词都要重新走一遍完整的前向传播,再把新词并入上下文继续算。这个阶段是访存密集型(memory-bound),每一步都要把全部模型权重从显存搬进计算单元,只为算出一个 token。

关键矛盾在于:即便模型在 Prefill 结束时已经形成了对问题的完整内部表征,只要走自回归流程,它就必须把答案一个字一个字写出来。后训练引入的思维链推理(DeepSeek-R1 这类 [8])让模型在给出结论前先生成大量思考内容,逻辑能力提升了,但 token 消耗和延迟也随之放大。

近几年的架构优化,无论是专家混合(MoE [9])还是各种注意力与 KV Cache 压缩方案,主要在降低每一步的计算与显存开销,并没有脱离逐字生成这个机制本身。

自回归解码与单次前向决策的耗时对比
自回归解码与单次前向决策的耗时对比

三、Jev 的非生成式输出

Jev 改变的正是输出机制。它不提供开放式文本对话,接口只处理三类决策原语 [10]

  • Choice:从你定义的候选集里选一个,最多支持 255 个选项,返回每个选项的概率和一个反映分布集中程度的 confidence 值;
  • Score:在你用自然语言描述的 2 到 10 级有序量表上打分,返回一个概率加权后的位置(可以落在两级之间);
  • Noul:判断某个陈述成立的概率,返回 0 到 1 的数值。

调用方式是一个统一端点,传入 state(上下文,可以是文本或 JSON)和一组命名问题。模型返回对应的数值概率,比如把工单分流给 technical、billing 或 sales 的具体百分比,不附带任何解释性文字。

这不同于大模型的结构化输出(JSON Mode)。 通用大模型开启 JSON 模式时,底层依然在执行逐 token 的 Decode 循环,只是通过约束解码强行限制采样空间,让模型只能吐出合法的花括号、字段名和格式字符。生成所需的推理步数一步都没少,省下的只是解析失败的概率。

Jev 的做法是完成 Prefill 之后,直接从最后一层的隐藏状态中读出各个选项对应的概率,跳过解码阶段。官方公布的端到端延迟是 70 到 500 毫秒,定价为每百万输入 token 0.042 美元、输出免费,并声称在同类任务上比前沿 LLM 快 40 到 200 倍 [11]。第三方实测的响应时间在 236 到 276 毫秒区间 [12]

为什么"不会幻觉"是结构性的:输出空间被限制在你预先声明的候选集上,模型物理上无法返回集合外的值,也无法产生格式错误。这不是训练出来的守规矩,而是接口层面的类型安全。代价是它只能回答你问的问题,不能告诉你"还有第四种可能你没想到"。


四、概率校准:这类模型真正的工程价值

如果一个模型的准确率是 95%,但无法给出可信的置信度,系统就很难对它的输出做分流处理——你不知道该信哪 95%。

校准(Calibration):模型输出 0.9 置信度的那批样本中,实际正确率应该接近 90%。常用度量是 ECE(Expected Calibration Error,把预测按置信度分桶,计算每桶内"置信度与实际准确率之差"的加权平均)和 Brier 分数(预测概率与真实标签的均方误差)。Guo 等人 2017 年的工作指出,现代深度网络普遍过度自信,而且模型越大越明显;温度缩放(Temperature Scaling,对 logits 除以一个标量 T 再 Softmax)是最简单有效的事后校准手段 [13]

校准良好之后,业务代码就可以基于数值区间设定规则:置信度高于 0.95 直接自动执行,0.7 到 0.95 触发二次检查,低于 0.7 流转人工。

置信度门控的分层处理架构
置信度门控的分层处理架构

Laya 公布的数据展示了校准的实际难度:基础 checkpoint 未经温度缩放时原始 ECE 为 0.213,经过领域温度拟合后降到 0.081 [14]。这也说明拿到一个模型直接读概率是不够的,必须在自己的数据分布上重新拟合温度。

这种机制适合把复杂的业务判断拆成多个独立的原子问题。检测钓鱼邮件时,不让模型直接判断整封邮件是否违规,而是拆解为:发件人与域名是否吻合、正文是否索要凭证、是否制造紧迫感、链接是否存在跳转伪装。每个原子问题输出一个概率,最终由程序控制流聚合判断。程序负责确定性的业务规则,模型只处理单点的模糊分类。


五、与传统分类器的差异,以及 Laya 的实现细节

单次前向传播直接输出分类概率,形式上很像传统的 BERT 分类器。两者的区别在于任务定义的位置

传统 BERT 分类器的任务逻辑固化在模型参数里:垃圾邮件模型只能识别垃圾邮件,情感分析模型只能识别情绪,类别数在训练时就写死在输出头的维度里,新增场景需要重新采集数据微调。Jev 这类模型则把问题、背景状态和候选项全部放进输入文本,在推理时动态理解具体的分类任务。

开源的 Laya [2:1] 给出了清晰的实现参照。它基于 ModernBERT-large [15](4.21 亿参数,英文)和多语言的 mmBERT-base(3.22 亿参数),属于 Encoder-only 结构,Apache-2.0 许可。

具体做法是:把背景信息、问题与候选项拼成一段输入,为每个候选选项分配独立的 [MASK],一次前向输出所有选项的 logits,经 Softmax 归一化为概率分布,全程不生成文本。T4 显卡上单问题 33 毫秒,批处理时每问题 7.2 毫秒 [2:2]。它还内置了一个亚毫秒级的纯 Python 路由器,通过 Unicode 脚本检测决定分发到英文还是多语言 checkpoint。

训练方法是 RLCD(Reinforcement Learning for Calibrated Decisions)。这个名字来自 TypeSafe 官方公告中对自研训练方法的命名 [1:1],Laya 沿用了同一术语。

严格适当评分规则(Strictly Proper Scoring Rule):一类奖励函数,其数学性质是"只有当模型报告的概率等于它真实的后验信念时,期望奖励才最大"。对数评分、球面评分、有序问题用的 RPS(Ranked Probability Score)都属于此类。用它作为 RL 奖励,意味着虚报高置信度在数学上是亏的,模型不确定时置信度自然会降下来——这是从训练目标层面解决过度自信,而不是事后靠温度缩放修补 [16]

需要注意的是,Laya 的高准确率依赖下游微调。 其基础 checkpoint 在 typed-decisions 基准上的零样本表现接近随机选择:英文 0.362、多语言 0.352,而随机基线是 0.318、多数类基线是 0.461 [14:1][17]。被广泛引用的 0.766 准确率,来自在该基准自己的训练集上微调过的专用 checkpoint [16:1]。官方模型卡的表述很直白:Laya 是一个可供快速特化的基座,而不是零样本模型。

另外,选项数量也有硬约束——候选项共享固定的 256 token 头部预算,选项建议控制在 20 个以内,标签空间过大时每个标签分到的 token 太少,准确率会急剧下降 [17:1]

所以真正的技术门槛不在"Transformer 后面挂一个决策头"这个结构上,那部分工程复杂度很低。门槛在通用理解能力:如何在不针对特定任务微调的前提下,单凭输入中的自然语言描述就稳定理解任意领域的分类问题。三到四亿参数的编码器在这一点上能力有限。Jev 未公开架构细节和参数规模,但从其零样本表现推测,底层大概率是规模显著更大的基座。

这也让 Jev 与 Laya 的对比需要谨慎看待:Laya 自己的模型卡注明,Jev 的数字是第三方公开数据而非同环境实测,样本量和提示词都不一致。同时在软概率匹配指标上 Laya 反而落后(0.471 对 0.580),也就是说它的 argmax 更准,但整体概率分布的形状不如 Jev 贴合教师分布 [14:2][16:2]


六、在系统架构中的位置

这类非生成式模型在架构中最合理的定位是链路前端的路由器:优先承接初步过滤、意图分流与风险打分,高置信度请求由程序直接执行;只有低置信度、或确实需要长文撰写与复杂推理的任务,才交给后端的生成式 LLM。

对安全场景而言,这个分层还有一个额外含义:把"判断"和"表达"解耦之后,决策层的输出是一个可审计的数值,而不是一段需要解析的自然语言。规则引擎能够消费它,阈值可以随攻防态势调整,误判率可以被统计和回归测试。这比让一个生成式模型在 prompt 里自己承诺"请只输出 yes 或 no"要可靠得多。

回看过去两年的工程实践,很多团队在落地大模型时其实走过一段“拿锤子找钉子”的弯路:因为生成式 LLM 展现出了惊艳的通用泛化能力,大家便习惯性地把所有业务逻辑塞进 Prompt,甚至连最简单的分类、路由,也要让一个动辄数百亿参数的模型去逐字解码输出一个 {"result": "pass"} 的 JSON。这种做法在原型验证期极为省事,但在高并发、强稳定性的生产环境下,却带来了吞吐低、延迟抖动大、显存浪费严重的工程代价。

Jev 与 Laya 的探索,本质上宣告了单体大模型(Monolithic LLM)在实际生产系统中开始走向分层与解耦

  1. 快思考(System 1)与慢思考(System 2)从概念变成了具体的基础设施。
    自回归解码和思维链(CoT)更适合处理长程推理、代码编写与发散生成的复杂任务(慢思考);而单次前向模型只专注于感知、归类与置信度评估(快思考)。将意图分流与确定性决策剥离至前端,不仅消除了大量不必要的自回归解码开销,也让端到端延迟降低了一个数量级。

  2. 评测体系重回经典统计学,摆脱“Prompt 玄学”。
    生成式模型最令工程团队头疼的是难以做确定性的单元测试和回归评估。而在非生成式决策体系中,温度缩放、ECE(期望校准误差)和 Brier 分数重新成为了核心标尺。这意味着系统可以像传统的风控、推荐引擎一样,基于数值阈值做灰度放量、A/B 测试和统计拦截,重新找回了传统软件工程的确定性。

  3. 落地选型的冷思考:谨防“轻量平替”的盲目乐观。
    面对这类新兴模型,选型时需要保持客观:Jev 的闭源形态展示了优秀的大参数零样本泛化能力,但存在厂商锁定和黑盒计费的隐患;而像 Laya 这种三四亿参数的开源模型,其基础权重在零样本下几乎不可用,强行拿来就用必然不及预期。开源方案的真正生命力在于私有域的快速特化——你必须有明确的业务数据闭环,能够针对自己的分布进行 RLCD 微调并拟合温度。

未来业务链路中的常态,大概率不再是一个大模型包办一切,而是小而准的决策头负责控盘,大而深的生成器负责输出。让决策的归决策,表达的归表达。




文章来源: https://www.cnpanda.net/talksafe/jev-laya-non-generative-decision-models.html
如有侵权请联系:admin#unsafe.sh