中文

BWArea 模型:用于可控语言生成的世界模型、逆动力学与策略学习

计算与语言 2024-05-28 v1 机器学习

摘要

大型语言模型 (LLM) 已引发自然语言处理领域的范式转变,但其有限的可控性为下游应用带来了显著挑战。我们旨在通过借鉴人脑的神经机制来解决这一问题,具体而言,是尤其关键于语言生成和理解的布罗卡区和韦尼克区。布罗卡区接收来自韦尼克区的认知决策信号,将语言生成视为一种复杂的决策过程,这不同于现有 LLM 的完全自回归语言生成方式。在此基础上,我们提出的 BWArea 模型将语言生成概念化为一个决策任务。该模型包含三个组件:语言世界模型、逆动力学模型和认知策略。就韦尼克区而言,逆动力学模型旨在推断每个 token 背后的潜在认知意图或潜在动作。BWArea 模型类似于现有 LLM,适用于预训练和微调。我们使用 300 亿干净的预训练 token 训练了一个 BWArea 模型,其性能与参数数量相同的 LLM (10 亿参数) 相当。不同于完全自回归的 LLM,BWArea 模型的预训练性能即使在意外出现的脏数据的情况下也不会退化。这表明了 BWArea 模型分解结构在减少繁琐数据选择和标注方面的优势。最后,我们揭示 BWArea 模型通过对认知策略进行微调(使用下游奖励指标)可实现更好的可控性,从而简化了更大的对齐工作。在 TextWorld 和 BigBench Hard 两个套件的 10 个任务中,本方法在 9 个任务上优于自回归 LLM。

关键词

引用

@article{arxiv.2405.17039,
  title  = {BWArea Model: Learning World Model, Inverse Dynamics, and Policy for Controllable Language Generation},
  author = {Chengxing Jia and Pengyuan Wang and Ziniu Li and Yi-Chen Li and Zhilong Zhang and Nan Tang and Yang Yu},
  journal= {arXiv preprint arXiv:2405.17039},
  year   = {2024}
}