SQuTR:面向语音查询文本检索的鲁棒性基准
信息检索
2026-05-14 v2 人工智能
摘要
语音查询检索是现代信息检索中的重要交互方式。然而,现有评估数据集常限于受约束噪声条件下的简单查询,难以评估语音查询检索系统在复杂声学扰动下的鲁棒性。为此,我们提出SQuTR,一个包含大规模数据集和统一评估协议的鲁棒性基准。SQuTR汇聚37,317个独立查询,来自六个常用英文和中文文本检索数据集,覆盖多个领域且查询类型多样。我们采用200名真实说话人的人声档案合成语音,并在受控信噪比下混合17类真实环境噪声,实现从安静到高度嘈杂的可复现鲁棒性评估。基于统一协议,在代表性级联式和端到端检索系统上进行大规模评估。实验结果表明,随着噪声增加,检索性能下降,且不同系统间下降幅度显著。即便是大规模检索模型在极端噪声下也难以维持性能,表明鲁棒性仍是关键瓶颈。总体而言,SQuTR为基准测试和诊断分析提供可复现的测试平台,促进语音查询到文本检索领域的鲁棒性研究。
引用
@article{arxiv.2602.12783,
title = {SQuTR: A Robustness Benchmark for Spoken Query to Text Retrieval under Acoustic Noise},
author = {Yuejie Li and Ke Yang and Yueying Hua and Berlin Chen and Jianhao Nie and Yueping He and Caixin Kang},
journal= {arXiv preprint arXiv:2602.12783},
year = {2026}
}
备注
Accepted by SIGIR 2026