中文

TREC 2025 VQA 轨道上的 HLTCOE 评估团队

计算机视觉与模式识别 2025-12-09 v1

摘要

HLTCOE 评估团队参加了 TREC VQA 的答案生成(AG)任务,构建了一个列表学习框架,旨在提高答案生成中的语义精度和排序一致性。给定视频-问题对,基础多模态模型首先生成多个候选答案,然后通过一个训练了新型掩码指针交叉熵损失带排序权重模型的模型对答案进行重新排序。该目标整合了基于指针的候选选择、排序相关性加权和受词汇限制的掩码交叉熵,实现稳定且可解释的列表级优化。通过将生成式建模与判别式排序相桥接,我们的方法产生连贯、细粒度的答案列表。实验表明,在准确率和排序稳定性方面均实现了一致的提升,尤其是对于需要时序推理和语义消歧的问题。

关键词

引用

@article{arxiv.2512.07738,
  title  = {HLTCOE Evaluation Team at TREC 2025: VQA Track},
  author = {Dengjia Zhang and Charles Weng and Katherine Guerrerio and Yi Lu and Kenton Murray and Alexander Martin and Reno Kriz and Benjamin Van Durme},
  journal= {arXiv preprint arXiv:2512.07738},
  year   = {2025}
}

备注

7 pages, 1 figure