基于基础模型的框架集成分割掩码的人-物互动预测
计算机视觉与模式识别
2025-04-29 v1 人工智能
摘要
本工作提出了一种名为 "Segmentation to Human-Object Interaction(Seg2HOI)" 的方法,一种将基于分割的视觉基础模型与人-物互动任务集成的新框架,区别于传统基于检测的方法。我们的做法通过不仅预测标准三元组,还引入四元组,这些四元组扩展了 HOI 三元组,包含了人-物对的分割掩码。具体而言,Seg2HOI 继承了视觉基础模型(例如提示可编程性和交互机制)的属性,并包含一个解码器将这些属性应用于 HOI 任务。尽管仅为 HOI 训练,无需额外的训练机制即可有效运行这些特征。广泛的实验在两个公共基准数据集上表明,Seg2HOI 在零样态情景下即达到了与最先进方法相当的性能。最后,我们提出 Seg2HOI 可从未用于训练的新文本和视觉提示生成 HOI 四元组和交互式 HOI 分割,使其在广泛的应用中具有灵活性。
引用
@article{arxiv.2504.19847,
title = {Foundation Model-Driven Framework for Human-Object Interaction Prediction with Segmentation Mask Integration},
author = {Juhan Park and Kyungjae Lee and Hyung Jin Chang and Jungchan Cho},
journal= {arXiv preprint arXiv:2504.19847},
year = {2025}
}