一种用于口语多选题问答的音频增强型基于BERT的框架
计算与语言
2020-05-26 v1
摘要
在口语多选题问答(SMCQA)任务中,给定一段语音形式的篇章、一个问题以及多个选项,机器需要挑选出正确选项来回答问题。尽管音频中可能包含对SMCQA有用的线索,但系统开发通常仅利用自动转写的文本。得益于大规模预训练语言表示模型,如来自Transformer的双向编码器表示(BERT),仅使用自动转写文本的系统仍能取得一定水平的性能。然而,先前研究已证明,声学级统计量能够弥补由自动语音识别系统引起的文本错误或在词嵌入生成器中潜藏的表示不足,从而使SMCQA系统更具鲁棒性。沿着该研究方向,本研究专注于设计一个基于BERT的SMCQA框架,其不仅继承了BERT所学习的上下文语言表示的优势,还将从音频中提取的互补声学级信息与文本级信息相融合。据此,提出了一种音频增强型基于BERT的SMCQA框架。一系列实验表明,在已发布的中文SMCQA数据集上,其准确率较所选基线和SOTA系统均有显著提升。
引用
@article{arxiv.2005.12142,
title = {An Audio-enriched BERT-based Framework for Spoken Multiple-choice Question Answering},
author = {Chia-Chih Kuo and Shang-Bao Luo and Kuan-Yu Chen},
journal= {arXiv preprint arXiv:2005.12142},
year = {2020}
}