B-RIGHT:用于通用人-物互动测试的基准测试重评估
计算机视觉与模式识别
2025-01-29 v1
摘要
人-物互动(Human-object interaction, HOI)是人工智能(AI)中的一个关键问题,旨在理解涉及人与物之间复杂关系的视觉世界。然而,当前的基准测试如 HICO-DET 面临以下局限性:(1)严重的类别不平衡问题;(2)某些类别的训练集与测试集数量差异。这些问题可能导致模型性能评估时出现虚高或虚低,最终损害评估分数的可靠性。本文提出了一种系统性的方法,用于开发新的类别平衡数据集,称为 Benchmark Re-evaluation for Integrity in Generalized Human-object Interaction Testing(B-RIGHT),以解决上述不平衡问题。B-RIGHT 通过采用平衡算法和自动化的生成与过滤过程,实现类别平衡,确保每个 HOI 类别的实例数量相等。此外,我们设计了一个平衡的零样本测试集,以系统性地评估在未见场景中的模型。使用 B-RIGHT 对现有模型进行重新评估后,发现得分方差显著减少,性能排名相对于传统 HICO-DET发生变化。我们的实验表明,在平衡条件下的评估能够确保更可靠和公平的模型比较。
引用
@article{arxiv.2501.16724,
title = {B-RIGHT: Benchmark Re-evaluation for Integrity in Generalized Human-Object Interaction Testing},
author = {Yoojin Jang and Junsu Kim and Hayeon Kim and Eun-ki Lee and Eun-sol Kim and Seungryul Baek and Jaejun Yoo},
journal= {arXiv preprint arXiv:2501.16724},
year = {2025}
}