DISCO:面向印欧语系不流畅校正的大规模人工标注语料库
计算与语言
2023-10-26 v1 人机交互
摘要
不流畅校正(DC)是从口语话语中移除填充词、重复和修正等不流畅元素以创建可读且可解释文本的过程。DC是应用于自动语音识别(ASR)输出的重要后处理步骤,先于下游语言理解任务进行后续处理。由于缺少大规模开源数据集,现有DC研究主要聚焦于英语。为实现多语言不流畅校正的目标,我们提出了一个覆盖四种重要印欧语系语言(英语、印地语、德语和法语)的高质量人工标注DC语料库。我们提供了最先进DC模型在所有四种语言上的结果的广泛分析,获得的F1分数为:英语97.55、印地语94.29、德语95.89和法语92.97。为展示DC对下游任务的益处,我们表明当DC与最先进的机器翻译(MT)系统结合使用时,BLEU分数平均提升5.65点。我们在此发布运行实验的代码及标注数据集。
引用
@article{arxiv.2310.16749,
title = {DISCO: A Large Scale Human Annotated Corpus for Disfluency Correction in Indo-European Languages},
author = {Vineet Bhat and Preethi Jyothi and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2310.16749},
year = {2023}
}
备注
Accepted at EMNLP 2023 Findings