中文

向离散自回归语言模型教授度量距离

机器学习 2026-05-08 v5 计算机视觉与模式识别

摘要

大型语言模型(LLMs)作为离散词表上的自回归预测器运行,这一表述使其应用远超自然语言,扩展至视觉、机器人和多模态推理。然而,基于独热目标的训练忽略了词元之间的度量关系,并限制了其在距离具有意义的任务上的有效性,例如数值、空间坐标或量化嵌入。我们引入了 DIST2Loss,一种用于离散自回归模型的距离感知目标函数,它用源自预定义词元距离的奖励加权分布替代独热目标。DIST2Loss 可以被解释为具有已知每词元奖励的熵正则化策略优化的闭式解,保留了强化学习的核心机制,同时避免了采样、展开和不稳定性。我们的实验表明,DIST2Loss 在多个领域提高了数据效率和下游性能。它在视觉定位中产生了更紧密的边界框,通过改进动作学习加速了机器人操作,增强了用于 LLM 对齐的奖励建模,并加强了向量量化图像生成。这些结果表明,距离感知监督为离散自回归模型提供了一种简单且通用的独热监督替代方案。

关键词

引用

@article{arxiv.2503.02379,
  title  = {Teaching Metric Distance to Discrete Autoregressive Language Models},
  author = {Jiwan Chung and Saejin Kim and Yongrae Jo and Jaewoo Park and Dongjun Min and Youngjae Yu},
  journal= {arXiv preprint arXiv:2503.02379},
  year   = {2026}
}