中文

基于话语重写的无监督对话话题分割模型

计算与语言 2024-09-13 v1 人工智能

摘要

对话话题分割在 various types of dialogue modeling tasks 中起着关键作用。当前最先进的无监督 DTS 方法通过相邻话语匹配和伪分割,从对话数据中学习话题感知的话语表征,以进一步挖掘无标记对话关系中的有用线索。然而,在多轮对话中,话语常存在指代消解或省略,导致直接将这些话语用于表征学习可能负面影响邻近话语匹配任务中的语义相似性计算。为了充分利用对话关系中的有用线索,本研究提出了一种新颖的无监督对话话题分割方法,将话语重写(Utterance Rewriting, UR)技术与无监督学习算法结合,通过重写对话以恢复指代消解和省略词汇,从而有效利用无标记对话中的有用线索。与现有无监督模型相比,提出的 Discourse Rewriting Topic Segmentation Model(UR-DTS)显著提高了话题分割的准确度。主要发现表明,DialSeg711 数据集上以绝对误差分数和 WD 为指标的性能分别提升约 6%,分别达到 11.42% 和 12.97%;在 Doc2Dial 数据集上,绝对误差分数和 WD 分别提升约 3% 和 2%,实现 SOTA,分别达到 35.17% 和 38.49%。这表明该模型在捕捉对话话题细微差别方面非常有效,以及利用无标记对话的有用性与挑战性。

关键词

引用

@article{arxiv.2409.07672,
  title  = {An Unsupervised Dialogue Topic Segmentation Model Based on Utterance Rewriting},
  author = {Xia Hou and Qifeng Li and Tongliang Li},
  journal= {arXiv preprint arXiv:2409.07672},
  year   = {2024}
}

备注

in Chinese language