中文

分段后审计:无参考语言指示音视频分段掩码质量评估

计算机视觉与模式识别 2026-02-05 v1 人工智能 机器学习 多媒体 声音 音频与语音处理

摘要

语言指示音视频分段 (Ref-AVS) 旨在通过联合推理视频、音频与文本,对由自然语言描述的目标对象进行分段。除了生成分段掩码外,为掩码质量提供丰富且可解释的诊断在实际中基本未被充分探索。本文引入掩码质量评估于 Ref-AVS 上下文中的任务 (MQA-RefAVS),这是一种无需在推理时依赖真值注释作为参考的新任务。给定音频-视频-文本输入及每个提供的分段掩码,任务要求估计其与未观测真值的 IoU,识别相应的错误类型,并建议可操作的质量控制决策。为支持该任务,我们构建了 MQ-RAVSBench,包含多样且具代表性的掩码错误模式,涵盖几何问题与语义问题。我们进一步提出了 MQ-Auditor,一种基于多模态大语言模型 (MLLM) 的评估器,通过显式推理多模态线索与掩码信息,生成定量与定性的掩码质量评估。大量实验表明,MQ-Auditor 在强大的开源与商业 MLLM 基准上均显著优于后者,可集成到现有的 Ref-AVS 系统中,以检测分段失效并支持下游分段改进。数据与代码将发布于 https://github.com/jasongief/MQA-RefAVS。

关键词

引用

@article{arxiv.2602.03892,
  title  = {Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation},
  author = {Jinxing Zhou and Yanghao Zhou and Yaoting Wang and Zongyan Han and Jiaqi Ma and Henghui Ding and Rao Muhammad Anwer and Hisham Cholakkal},
  journal= {arXiv preprint arXiv:2602.03892},
  year   = {2026}
}