中文

VoxRAG:面向语音问答的无转录检索增强生成系统

信息检索 2025-08-08 v1 声音 音频与语音处理

摘要

我们提出 VoxRAG,一种模块化的语音转语音检索增强生成系统,绕过转录,直接从语音查询中检索语义相关的音频片段。VoxRAG 采用静音感知分段、说话人分割、CLAP 音频嵌入和基于 L2 归一化余弦相似性的 FAISS 检索。我们构建了一个由以英语为母语的说话人录制的 50 条查询测试集。通过 LLM 作为评判员评估检索质量。对于非常相关的片段,余弦相似度在 Recall@10 上达到 0.34;对于较为相关的片段,Recall@10 提升至 0.60,nDCG@10 为 0.27,凸显强大的主题对齐。答案质量在相关性、准确性、完整性和精确度四个维度上以 0--2 比例评判,平均分为 0.84、0.58、0.56 和 0.46。尽管检索质量和精确度仍是关键限制,VoxRAG 显示出在 RAG 系统中实现无转录语音转语音检索是可行的。

关键词

引用

@article{arxiv.2505.17326,
  title  = {VoxRAG: A Step Toward Transcription-Free RAG Systems in Spoken Question Answering},
  author = {Zackary Rackauckas and Julia Hirschberg},
  journal= {arXiv preprint arXiv:2505.17326},
  year   = {2025}
}

备注

Accepted to ACL 2025 Workshop MAGMaR