SuperDialseg:面向监督对话分割的大规模数据集
计算与语言
2023-10-17 v2
摘要
对话分割是使对话系统更好理解会话文本的关键任务。尽管无监督对话分割方法近期取得进展,其性能受限于缺乏用于训练的显式监督信号。此外,会话中分割点的精确定义仍是具有挑战性的问题,增加了人工标注收集的困难。本文借助文档 grounded 对话给出对话分割点的可行定义,并发布名为 SuperDialseg 的大规模监督数据集,包含基于两个主流文档 grounded 对话语料的 9,478 段对话,并继承了它们有用的对话相关标注。此外,我们提供涵盖五类 18 个模型的对话分割任务基准及若干恰当评价指标。实证研究表明,监督学习在域内数据集上极为有效,且基于 SuperDialseg 训练的模型在域外数据上具备良好泛化能力。另外,我们在测试集上进行了人工校验,Kappa 分数证实了自动构建数据集的质量。我们认为本工作是对话分割领域的重要进展。代码与数据见:https://github.com/Coldog2333/SuperDialseg。
关键词
引用
@article{arxiv.2305.08371,
title = {SuperDialseg: A Large-scale Dataset for Supervised Dialogue Segmentation},
author = {Junfeng Jiang and Chengzhang Dong and Sadao Kurohashi and Akiko Aizawa},
journal= {arXiv preprint arXiv:2305.08371},
year = {2023}
}
备注
Accepted as a Long Paper at EMNLP 2023 (main)