DuoTeach:面向视觉-语言模型的双角色自教粗到细决策协调
多媒体
2026-03-20 v2 计算机视觉与模式识别
摘要
粗到细路径决策需要预测一个有效的分类学路径,其中早期决策约束后续决策。然而,现有基准测试独立评分每个层级,掩盖了跨层级的有效性和一致性。为更好地对齐评估与此设定,我们引入联合路径决策(Joint Path Decision, JPD)协议,要求一次性预测完整路径,并提出深度加权前缀准确率(Depth-Weighted Prefix Accuracy, DWPA)指标族,这些指标在可调节强调深层级的基础上衡量路径可靠性。在 JPD 下,强大的视觉-语言模型(VLMs)经常产生无效的父子配对和脆弱的完整路径预测,表明其失败不仅源于分类学知识不完整,也源于跨层级决策协调不稳定。为此,我们提出 DuoTeach,一个无需真实标签的双角色自教蒸馏框架,复用相同的预训练 VLM 在两个角色中。其决策条件化滚动(Decision-Conditioned Rollout, DCR)通过对每个层级以先前决策为条件来生成更连贯的教师轨迹,并在不额外测试时滚动的情况下将此协调行为蒸馏到学生模型。在多个分类学结构基准测试和 VLM 基础模型上,DuoTeach 在原位 DWPA(alpha = 0.95)上提升最高可达 30.24 分,并将零样本在未见分类学上的表现从 17.17% 提升至 43.66%。进一步分析归因于改进的调用内多层决策协调。
引用
@article{arxiv.2511.18415,
title = {DuoTeach: Dual Role Self-Teaching for Coarse-to-Fine Decision Coordination in Vision--Language Models},
author = {Wei Yang and Yiran Zhu and Zilin Li and Xunjia Zhang and Jun Xia and Hongtao Wang},
journal= {arXiv preprint arXiv:2511.18415},
year = {2026}
}