中文

视觉大语言模型是参与分析中的优秀噪声处理器

计算机视觉与模式识别 2025-11-19 v1

摘要

视频数据集中的参与度识别,与传统图像分类任务不同,面临主观标签和噪声限制模型性能。为克服主观和嘈杂参与标签的挑战,我们提出了一个框架利用视觉大语言模型(VLM)来细化标注并指导训练过程。我们的框架使用问卷提取行为线索并将数据划分为高可靠性和低可靠性子集。我们还引入一种结合课程学习和软标签细化的训练策略,逐渐纳入含糊样本并调整监督以反映不确定性。我们表明,对高可靠性子集进行训练的经典计算机视觉模型结合我们的课程策略显示出改进,凸显了利用 VLM 解决标签主观性的优势。该方法在 EngageNet(六个特征设置中三个最佳,最大改进+1.21%)、DREAMS / PAFE 上实现 F1 提升+0.22 / +0.06,超越了先前的状态-of-the-art。

关键词

引用

@article{arxiv.2511.14749,
  title  = {Vision Large Language Models Are Good Noise Handlers in Engagement Analysis},
  author = {Alexander Vedernikov and Puneet Kumar and Haoyu Chen and Tapio Seppänen and Xiaobai Li},
  journal= {arXiv preprint arXiv:2511.14749},
  year   = {2025}
}