知识增强微调以更好地处理对话生成中的未见过实体
计算与语言
2021-09-14 v1
摘要
尽管预训练模型在对话生成中取得了巨大成功,但当输入包含未出现在预训练和微调数据集中的实体(未见过实体)时,其性能会急剧下降。为解决此问题,现有方法利用外部知识库生成恰当回复。在实际场景中,该实体可能未被知识库收录,或受知识检索精度所限。为处理该问题,我们不是将知识库作为输入引入,而是仅基于输入上下文,通过预测知识库中的信息来迫使模型学习更好的语义表示。具体而言,在知识库帮助下,我们引入两个辅助训练目标:1)解释掩码词,即根据上下文推测被掩码实体的含义;2)上位词生成,即基于上下文预测该实体的上位词。在两个对话语料上的实验结果验证了我们的方法在知识可用与不可用设置下的有效性。
引用
@article{arxiv.2109.05487,
title = {Knowledge Enhanced Fine-Tuning for Better Handling Unseen Entities in Dialogue Generation},
author = {Leyang Cui and Yu Wu and Shujie Liu and Yue Zhang},
journal= {arXiv preprint arXiv:2109.05487},
year = {2021}
}
备注
EMNLP 2021