中文

长音频访谈与问题的时序对齐:多模态数据集成案例研究

计算与语言 2023-10-11 v1 机器学习 声音 音频与语音处理

摘要

音频到文本对齐问题在训练中使用完全监督的情况下已得到大量研究。然而,这通常不是在长音频录音的背景下,其中被查询的文本并未逐字出现在音频文件中。本工作是与非政府组织 CARE India 的合作,该组织收集了居住在印度比哈尔邦农村地区的年轻母亲的长音频健康调查。给定用于指导这些调查的一份问卷中的问题,我们的目标是在长音频录音中定位该问题被提出的位置。这对于非洲和亚洲的组织具有重大价值,否则它们将不得不费力地浏览冗长且嘈杂的音频录音以定位感兴趣的问题(和答案)。我们提出的框架 INDENT 使用基于交叉注意力的模型和关于句子时间顺序的先验信息,来学习捕捉底层口语文本语义的语音嵌入。这些学习到的嵌入用于在推理时基于文本查询检索相应的音频片段。我们通过实验证明了我们的模型相对于基于文本启发式方法取得的显著有效性(R-avg 提升约 3%)。我们还展示了使用最先进的印度语言 ASR 模型生成的含噪 ASR 在替代语音使用时产生更好的结果。仅在 Hindi 数据上训练的 INDENT 能够服务于(语义上)共享文本空间所支持的所有语言。我们在 11 种印度语言上通过实验说明了这一点。

关键词

引用

@article{arxiv.2310.06702,
  title  = {Temporally Aligning Long Audio Interviews with Questions: A Case Study in Multimodal Data Integration},
  author = {Piyush Singh Pasi and Karthikeya Battepati and Preethi Jyothi and Ganesh Ramakrishnan and Tanmay Mahapatra and Manoj Singh},
  journal= {arXiv preprint arXiv:2310.06702},
  year   = {2023}
}

备注

Work Accepted in IJCAI-23- AI and Social Good Track