面向标签不足的开放式视频问答的排序蒸馏方法
计算机视觉与模式识别
2024-03-22 v1
摘要
本文聚焦于开放式视频问答,其目标是从一个大型答案集中为与视频相关的问题找到正确答案。这本质上是一个多标签分类任务,因为一个问题可能有多个答案。然而,由于标注成本,现有基准中的标签总是极其不足,通常每个问题只有一个答案。因此,现有工作倾向于直接将所有未标注的答案视为负标签,导致泛化能力有限。在这项工作中,我们引入了一个简单而有效的排序蒸馏框架(RADI),以在无需额外人工标注的情况下缓解此问题。RADI 采用一个用不完整标签训练的教师模型来生成潜在答案的排序,这些排序包含了关于标签优先级以及标签相关视觉线索的丰富知识,从而丰富了不足的标注信息。为避免对不完美教师模型的过度自信,我们进一步提出了两种鲁棒且无参数的排序蒸馏方法:一种成对方法,引入自适应软间隔以动态优化各种成对排序上的优化约束;以及一种列表式方法,采用基于采样的部分列表式学习以抵抗教师排序中的偏差。在五个流行基准上的广泛实验一致表明,我们的成对和列表式 RADI 均优于最先进的方法。进一步分析证明了我们的方法在标签不足问题上的有效性。
引用
@article{arxiv.2403.14430,
title = {Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels},
author = {Tianming Liang and Chaolei Tan and Beihao Xia and Wei-Shi Zheng and Jian-Fang Hu},
journal= {arXiv preprint arXiv:2403.14430},
year = {2024}
}
备注
Accepted to CVPR 2024