HistAlign:通过对齐历史提升语言生成中的上下文依赖性
计算与语言
2023-12-05 v2 人工智能
机器学习
摘要
语言模型(LMs)可能生成幻觉和不连贯的输出,这凸显了它们较弱的上下文依赖性。Cache-LM 通过为 LMs 增加近期历史记忆,能够增强上下文依赖性,并在多种语言生成任务中展现出卓越性能。然而,我们发现即便经过训练,当前 cache-LM 中缓存组件带来的性能提升仍不理想,其原因在于当前隐藏状态与记忆中存储的状态之间存在错位。在本工作中,我们提出 HistAlign,一种确保良好缓存对齐的新训练方法,使模型能从历史中获得有用信号。我们首先在一个简单合成任务上验证概念,该任务中记忆对正确预测至关重要,并展示 HistAlign 的缓存组件对齐更好且提升了整体性能。接着,我们在多种下游语言生成任务上评估 HistAlign,包括提示续写、抽象式摘要和数据到文本生成。我们证明 HistAlign 分别在开放式和条件生成设定中提升了文本连贯性与忠实性。HistAlign 还可泛化至不同模型族,展现了其在多样场景中提升 LMs 上下文依赖性的优势。我们的代码已公开于 https://github.com/meetdavidwan/histalign。
引用
@article{arxiv.2305.04782,
title = {HistAlign: Improving Context Dependency in Language Generation by Aligning with History},
author = {David Wan and Shiyue Zhang and Mohit Bansal},
journal= {arXiv preprint arXiv:2305.04782},
year = {2023}
}
备注
EMNLP 2023 (20 pages)