辅助社群处理受限访问语料以开展语言复兴的自动化语音工具
计算与语言
2022-04-26 v2 声音
音频与语音处理
摘要
许多濒危语言的语音档案录音仍未加标注,且社群成员与语言学习项目无法获取。一个瓶颈是标注的耗时性。对于存在访问约束的录音,瓶颈更窄:此类语言须由授权社群成员审核或过滤后,方可开始标注。我们提出一种隐私保护工作流,以缓解这两重瓶颈,适用于濒危语言与更广泛使用的语言(如英语)混杂用于元语言评注与提问(例如“tree”一词怎么说?)的录音。我们集成语音活动检测(VAD)、口语语言识别(SLI)与自动语音识别(ASR)来转写元语言内容,授权人员可快速浏览,以分诊可由较低访问权限者标注的录音。我们报告了处理136小时含英语与Muruwari混杂的档案音频的进展中工作。我们与档案材料Muruwari保管者的协作表明,即便仅给定最少量的标注训练数据——每语言10条话语用于SLI,用于ASR至多39分钟且可能少至39秒——该工作流也将元语言转写时间减少了20%。
引用
@article{arxiv.2204.07272,
title = {Automated speech tools for helping communities process restricted-access corpora for language revival efforts},
author = {Nay San and Martijn Bartelds and Tolúlopé Ògúnrèmí and Alison Mount and Ruben Thompson and Michael Higgins and Roy Barker and Jane Simpson and Dan Jurafsky},
journal= {arXiv preprint arXiv:2204.07272},
year = {2022}
}
备注
Accepted at ComputEL-5