基于编辑操作引导与话语增强的不完整话语重写
计算与语言
2025-03-21 v1 人工智能
摘要
尽管现有的不完整话语重写(IUR)主流生成方法能够生成连贯的话语,但由于无法聚焦于对话上下文中的关键 token,它们往往在重写的话语中包含无关且冗余的 token。此外,训练数据集规模有限也导致了 IUR 模型训练不足。为了解决第一个问题,我们提出了一个多任务学习框架 EO-IUR(Editing Operation-guided Incomplete Utterance Rewriting,编辑操作引导的不完整话语重写),该框架引入由序列标注模块生成的编辑操作标签,以引导生成模型聚焦于关键 token。此外,我们引入了一个 token 级异构图来表示对话。为了解决第二个问题,我们提出了一种二维话语增强策略,即基于编辑操作的不完整话语增强和基于 LLM 的历史话语增强。在三个数据集上的实验结果表明,我们的 EO-IUR 在开放域和任务导向对话中均优于先前最先进的(SOTA)基线。代码将发布于 https://github.com/Dewset/EO-IUR。
引用
@article{arxiv.2503.16043,
title = {Incomplete Utterance Rewriting with Editing Operation Guidance and Utterance Augmentation},
author = {Zhiyu Cao and Peifeng Li and Yaxin Fan and Qiaoming Zhu},
journal= {arXiv preprint arXiv:2503.16043},
year = {2025}
}