AURORA:结构化推理与强化学习增强参考音视频分割理解
计算机视觉与模式识别
2025-12-11 v2
摘要
参考音视频分割(Ref-AVS)任务挑战模型精确定位发声对象,需整合视觉、听觉和文本线索。现有方法常缺乏真正的语义理解,倾向于记忆固定的推理模式。此外,联合训练推理与分割可能损害像素级精度。为解决此问题,我们引入AURORA框架,以增强参考音视频分割中的真实推理与语言理解。我们采用结构化链式思维(CoT)提示机制引导模型进行分步骤推理,引入新型分割特征蒸馏损失有效整合推理能力而不牺牲分割性能。为进一步培育模型的真实推理能力,设计了两阶段训练策略:首先采用纠错式训练提升推理路径质量,随后通过群体奖励策略优化(GRPO)进行强化学习,以增强面对挑战性场景的鲁性。实验表明,AURORA在Ref-AVS基准测试上实现了最先进性能,并能有效泛化至未引用分割。
引用
@article{arxiv.2508.02149,
title = {AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation},
author = {Ziyang Luo and Nian Liu and Fahad Shahbaz Khan and Junwei Han},
journal= {arXiv preprint arXiv:2508.02149},
year = {2025}
}
备注
AAAI2026,code:https://github.com/Sssssuperior/AURORA