基于潜在情境的语言建模
计算与语言
2022-12-21 v1
摘要
语言模型(LMs)常生成不连贯的输出:它们提及与其输入所描述的世界状态不相容的事件和实体状态。我们引入SituationSupervision,一类通过训练LMs构建并基于显式的实体及其状态表示进行条件化从而提升连贯性的方法。SituationSupervision有两个组成部分:一个辅助情境建模任务,训练模型在上下文中预测状态表示;以及一个潜在状态推断过程,从部分标注的训练数据中推算这些状态。SituationSupervision既可应用于微调(通过监督LMs在其隐藏表示中编码状态变量),也可应用于提示(通过引导LMs将实体状态的文本描述与输出文本交错)。在这两种情况下,SituationSupervision仅需少量状态标注即可带来显著的连贯性提升(介于4-11%),表明标准LMs可以被以小样本高效的方式训练为不仅建模语言,还建模其所描述的情形。
引用
@article{arxiv.2212.10012,
title = {Language Modeling with Latent Situations},
author = {Belinda Z. Li and Maxwell Nye and Jacob Andreas},
journal= {arXiv preprint arXiv:2212.10012},
year = {2022}
}
备注
13 pages, 3 figures, 7 tables