中文

$\Delta$-AttnMask:用于高效数据选择与增强的注意力引导掩码隐藏状态

计算机视觉与模式识别 2025-08-14 v1 人工智能 计算与语言

摘要

视觉指令微调(VIF)对于视觉语言模型(VLM)的训练后阶段至关重要。与纯文本大语言模型中主要要求数据集具备指令遵循能力的单模态指令微调不同,VIF 还需要多模态数据以实现视觉与文本的联合理解;因此,它通常需要更多数据。 consequently,VIF 带来了更严格的数据选择挑战:该方法必须在确保视觉与文本内容质量及其对齐的同时,高效扩展以应对更大的数据需求。尽管数据选择对性能有至关重要的影响,但 VIF 的数据选择仍是一个研究不足的领域。在本文中,我们提出了 Δ\Delta-AttnMask。这一数据高效框架通过对模型隐藏状态进行注意力引导的掩码来量化样本质量,无需领域标签、辅助模型或额外训练即可联合评估图像-文本对。通过计算原始状态与使用高注意力区域掩码后状态之间的损失差(Δ\Delta),Δ\Delta-AttnMask 能够内在地评估样本质量。在多个 VLM 和数据集上的实验表明,Δ\Delta-AttnMask 仅使用 20% 的数据就实现了 SOTA 性能,将训练速度提升了 5 倍,同时在总体准确率上比全数据集基线高出 +10.1%。其模型无关且数据无关的设计确保了其在不同模态和架构上的广泛适用性。

关键词

引用

@article{arxiv.2508.09199,
  title  = {$\Delta$-AttnMask: Attention-Guided Masked Hidden States for Efficient Data Selection and Augmentation},
  author = {Jucheng Hu and Suorong Yang and Dongzhan Zhou},
  journal= {arXiv preprint arXiv:2508.09199},
  year   = {2025}
}