MonSTeR:统一的运动、场景、文本检索模型
计算机视觉与模式识别
2025-10-06 v1
摘要
意图驱动人类在复杂环境中的运动,但这种运动只有当周围环境提供支持时才可能发生。尽管这种机制具有直观性,但现有研究尚未提供工具来评估骨骼运动(motion)、意图(text)与周围环境(scene)之间的对齐程度。本文介绍 MonSTeR,这是首个 MOtioN-Scene-TExt 检索模型。受高阶关系建模启发,MonSTeR 利用单模态和跨模态表示构建统一的潜在空间,这使 MonSTeR 能够捕捉模态间的复杂依赖,实现对各种任务的灵活而稳健的检索。我们的结果表明,MonSTeR 在仅依赖单模态表示的多模态模型中性能更佳。此外,我们通过专门的用户研究验证了检索得分与人类偏好的对齐。我们展示了 MonSTeR 潜在空间在零样本场景中对象放置和运动描述中的通用性。代码和预训练模型已在 github.com/colloroneluca/MonSTeR 上提供。
引用
@article{arxiv.2510.03200,
title = {MonSTeR: a Unified Model for Motion, Scene, Text Retrieval},
author = {Luca Collorone and Matteo Gioia and Massimiliano Pappa and Paolo Leoni and Giovanni Ficarra and Or Litany and Indro Spinelli and Fabio Galasso},
journal= {arXiv preprint arXiv:2510.03200},
year = {2025}
}