中文

SuperDialseg:面向监督对话分割的大规模数据集

计算与语言 2023-10-17 v2

摘要

对话分割是使对话系统更好理解会话文本的关键任务。尽管无监督对话分割方法近期取得进展,其性能受限于缺乏用于训练的显式监督信号。此外,会话中分割点的精确定义仍是具有挑战性的问题,增加了人工标注收集的困难。本文借助文档 grounded 对话给出对话分割点的可行定义,并发布名为 SuperDialseg 的大规模监督数据集,包含基于两个主流文档 grounded 对话语料的 9,478 段对话,并继承了它们有用的对话相关标注。此外,我们提供涵盖五类 18 个模型的对话分割任务基准及若干恰当评价指标。实证研究表明,监督学习在域内数据集上极为有效,且基于 SuperDialseg 训练的模型在域外数据上具备良好泛化能力。另外,我们在测试集上进行了人工校验,Kappa 分数证实了自动构建数据集的质量。我们认为本工作是对话分割领域的重要进展。代码与数据见:https://github.com/Coldog2333/SuperDialseg。

关键词

引用

@article{arxiv.2305.08371,
  title  = {SuperDialseg: A Large-scale Dataset for Supervised Dialogue Segmentation},
  author = {Junfeng Jiang and Chengzhang Dong and Sadao Kurohashi and Akiko Aizawa},
  journal= {arXiv preprint arXiv:2305.08371},
  year   = {2023}
}

备注

Accepted as a Long Paper at EMNLP 2023 (main)