中文

基于自动语音识别的欧盟辩论政治语料库构建

计算与语言 2023-04-18 v1

摘要

在本文中,我们呈现了一个欧盟议会LIBE委员会的转写语料库,总计360万运行词。欧盟议会各委员会会议对政治科学家而言是潜在的有价值信息源,但由于仅以语音录音及有限元数据形式公开,这些数据并不易于获取。会议以英语进行,部分由非母语者发言,部分由口译员发言。我们研究了最合适的自动语音识别(ASR)模型,以对会议录音创建准确的文本转写,从而使其内容可用于研究和分析。我们聚焦于ASR流水线的无监督域适应。基于transformer架构的Wav2vec2.0模型,我们尝试了多种声学模型、语言模型以及添加领域特定术语。我们发现领域特定的声学模型与领域特定的语言模型显著改善了ASR输出,将词错误率(WER)从28.22降至17.95。在解码阶段使用领域特定术语对WER意义上的ASR质量未产生正向影响。初步的主题建模结果表明该语料库对下游分析任务有用。我们发布了所得语料库及我们的分析流水线以供未来研究。

关键词

引用

@article{arxiv.2304.08137,
  title  = {Political corpus creation through automatic speech recognition on EU debates},
  author = {Hugo de Vos and Suzan Verberne},
  journal= {arXiv preprint arXiv:2304.08137},
  year   = {2023}
}

备注

22 pages, 2 figures