中文

通过众包扩展音频-视觉质量评估数据集

计算机视觉与模式识别 2026-02-27 v1 多媒体

摘要

音频-视觉质量评估 (AVQA) 研究受限于现有数据集:规模较小、内容与质量的多样性不足,仅标注整体评分。这些局限性不利于模型开发和多模态感知研究。我们提出一种实用的数据集构建方法。首先,我们设计了 AVQA 的众包主观实验框架,打破实验室环境的限制,实现了在不同环境下的可靠标注。其次,采用系统性的数据准备策略,确保质量水平和语义情景的广泛覆盖。然后,我们扩展数据集,添加了额外标注,支持研究多模态感知机制及其与内容的关系。最后,通过 YT-NTU-AVQ 数据集验证了此方法,该数据集目前规模最大、最具多样性,包含 1,620 个用户生成的音频和视频序列。数据集和平台代码已公开于 https://github.com/renyu12/YT-NTU-AVQ。

关键词

引用

@article{arxiv.2602.22659,
  title  = {Scaling Audio-Visual Quality Assessment Dataset via Crowdsourcing},
  author = {Renyu Yang and Jian Jin and Lili Meng and Meiqin Liu and Yilin Wang and Balu Adsumilli and Weisi Lin},
  journal= {arXiv preprint arXiv:2602.22659},
  year   = {2026}
}

备注

Accepted to ICASSP 2026. 5 pages (main paper) + 8 pages (supplementary material)