通过语义聚类解决动作识别中的动词歧义问题
计算与语言
2026-01-27 v2 人工智能
计算机视觉与模式识别
摘要
评估视觉活动识别系统具有挑战性,因为动词语义和图像解释存在内在歧义。描述图像中的动作时,同义动词可以指指同一事件(例如刷子 vs. 护理),而不同视角可以导致 equally valid 但 distinct 的动词选择(例如驾驶 vs. 操作)。标准的精确匹配评估依赖于单个金标准答案,无法捕捉这些歧义,导致对模型性能的评估不完整。为此,我们提出一种视觉语言聚类框架,用于构建动词语义聚类,提供更稳健的评估。我们的分析表明,每个图像映射到约四个语义聚类,其中每个聚类代表图像的不同视角。我们评估了多个活动识别模型并比较了基于聚类的评估与标准评估方法。此外,我们的人类对齐分析表明,基于聚类的评估更符合人类判断,为模型性能提供了更细致的评估。
引用
@article{arxiv.2508.04945,
title = {Towards Robust Evaluation of Visual Activity Recognition: Resolving Verb Ambiguity with Sense Clustering},
author = {Louie Hong Yao and Nicholas Jarvis and Tianyu Jiang},
journal= {arXiv preprint arXiv:2508.04945},
year = {2026}
}
备注
Accepted to Findings of the Association for Computational Linguistics: EACL 2026