分段后审计:无参考语言指示音视频分段掩码质量评估
计算机视觉与模式识别
2026-02-05 v1 人工智能
机器学习
多媒体
声音
音频与语音处理
摘要
语言指示音视频分段 (Ref-AVS) 旨在通过联合推理视频、音频与文本,对由自然语言描述的目标对象进行分段。除了生成分段掩码外,为掩码质量提供丰富且可解释的诊断在实际中基本未被充分探索。本文引入掩码质量评估于 Ref-AVS 上下文中的任务 (MQA-RefAVS),这是一种无需在推理时依赖真值注释作为参考的新任务。给定音频-视频-文本输入及每个提供的分段掩码,任务要求估计其与未观测真值的 IoU,识别相应的错误类型,并建议可操作的质量控制决策。为支持该任务,我们构建了 MQ-RAVSBench,包含多样且具代表性的掩码错误模式,涵盖几何问题与语义问题。我们进一步提出了 MQ-Auditor,一种基于多模态大语言模型 (MLLM) 的评估器,通过显式推理多模态线索与掩码信息,生成定量与定性的掩码质量评估。大量实验表明,MQ-Auditor 在强大的开源与商业 MLLM 基准上均显著优于后者,可集成到现有的 Ref-AVS 系统中,以检测分段失效并支持下游分段改进。数据与代码将发布于 https://github.com/jasongief/MQA-RefAVS。
引用
@article{arxiv.2602.03892,
title = {Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation},
author = {Jinxing Zhou and Yanghao Zhou and Yaoting Wang and Zongyan Han and Jiaqi Ma and Henghui Ding and Rao Muhammad Anwer and Hisham Cholakkal},
journal= {arXiv preprint arXiv:2602.03892},
year = {2026}
}