为眼睛记录,而非为耳朵回声:ASR转录文本的语境化口语到书面语转换
计算与语言
2025-01-27 v4
摘要
自动语音识别(ASR)转录文本存在识别错误以及各种口语现象,如不流畅、不合语法和不完整的句子,因此可读性较差。为提升可读性,我们提出语境化口语到书面语转换(CoS2W)任务,旨在利用语境和辅助信息修正ASR和语法错误,并将非正式文本转换为正式风格,同时保留内容。该任务天然契合大语言模型(LLM)的上下文学习能力。为促进对各种LLM的全面比较,我们构建了文档级ASR转录文本口语到书面语转换基准(SWAB)数据集。利用SWAB,我们研究了不同粒度对CoS2W性能的影响,并提出了利用语境和辅助信息以增强输出的方法。实验结果表明,LLM在CoS2W任务中具有出色潜力,尤其在语法性和正式性方面;我们提出的方法使LLM能够有效理解语境和辅助信息。我们进一步研究了将LLM用作评估者的有效性,发现LLM评估者在忠实性和正式性排序上与人评具有强相关性,从而验证了LLM评估者用于CoS2W任务的可靠性。
引用
@article{arxiv.2408.09688,
title = {Recording for Eyes, Not Echoing to Ears: Contextualized Spoken-to-Written Conversion of ASR Transcripts},
author = {Jiaqing Liu and Chong Deng and Qinglin Zhang and Shilin Zhou and Qian Chen and Hai Yu and Wen Wang},
journal= {arXiv preprint arXiv:2408.09688},
year = {2025}
}
备注
12 pages, 3 figures