语言模型中的实体追踪
计算与语言
2023-09-11 v2
摘要
追踪实体状态如何随文本或对话展开而变化是话语理解的关键前提。然而,关于大语言模型(LLMs)追踪话语实体能力的系统性研究很少。在这项工作中,我们提出了一个任务,探究语言模型在给定实体初始状态的英文描述及一系列状态改变操作的情况下,能在多大程度上推断实体的最终状态。我们利用该任务首先研究 Flan-T5、GPT-3 和 GPT-3.5 是否能追踪实体状态,发现只有经过大量代码预训练的 GPT-3.5 模型展现出这种能力。然后我们研究主要通过文本预训练的较小模型是否能通过学习追踪实体,通过对 T5 在多个训练/评估划分上进行微调。尽管在更复杂的划分上性能下降,我们发现即使在评估时使用与训练不同的实体集合或更长的操作序列,微调模型也能执行非平凡的实体追踪。综合来看,这些结果表明语言模型可以学会追踪实体,但仅对文本语料的预训练不会使这一能力显现。
引用
@article{arxiv.2305.02363,
title = {Entity Tracking in Language Models},
author = {Najoung Kim and Sebastian Schuster},
journal= {arXiv preprint arXiv:2305.02363},
year = {2023}
}
备注
ACL 2023 Camera-ready