MultiTurnCleanup:面向多轮口语对话转写文本清理的基准
计算与语言
2023-10-30 v2 人工智能
机器学习
摘要
当前的口误检测模型聚焦于来自单一说话人的独立话语。然而,口语对话转写文本中大量不连贯现象跨越多个话轮出现,损害了人类可读性及下游 NLP 任务的性能。本研究通过提出一项面向口语对话转写文本的创新性多轮清理任务并收集新数据集 MultiTurnCleanup1 来解决这些现象。我们设计了数据标注模式以收集高质量数据集并提供详尽的数据分析。此外,我们利用两种建模方法进行实验评估,作为未来研究的基准。
引用
@article{arxiv.2305.12029,
title = {MultiTurnCleanup: A Benchmark for Multi-Turn Spoken Conversational Transcript Cleanup},
author = {Hua Shen and Vicky Zayats and Johann C. Rocholl and Daniel D. Walker and Dirk Padfield},
journal= {arXiv preprint arXiv:2305.12029},
year = {2023}
}
备注
EMNLP 2023 main conference. Dataset: https://github.com/huashen218/MultiTurnCleanup