AutoComPose:使用多模态大语言模型自动生成姿态转换描述用于组合姿态检索
计算机视觉与模式识别
2025-08-20 v2
摘要
组合姿态检索(CPR)使用户通过指定参考姿态和转换描述来搜索人类姿态,但该领域的进展受限于标注姿态转换的稀缺性和不一致性。现有 CPR 数据集依赖于高成本的人工标注或基于启发式规则的生成方法,两者都限制了可扩展性和多样性。本文引入 AutoComPose,首个利用多模态大语言模型(MLLM)自动生成丰富且结构化姿态转换描述的框架。我们的方法通过将转换结构化为细粒度身体部位运动并引入镜像/交换变体,来增强标注质量;同时引入循环一致性约束以确保前向和逆向转换之间的逻辑一致性。为推进 CPR 研究,我们构建并发布了两个专用基准数据集,AIST-CPR 和 PoseFixCPR,补充了具有增强属性的先前数据集。广泛实验表明,使用 AutoComPose 训练的检索模型在人工标注和基于启发式的方法之上,显著降低了标注成本并提升了检索质量。我们的工作首次实现姿态转换的自动标注,为未来 CPR 研究奠定了可扩展基础。
引用
@article{arxiv.2503.22884,
title = {AutoComPose: Automatic Generation of Pose Transition Descriptions for Composed Pose Retrieval Using Multimodal LLMs},
author = {Yi-Ting Shen and Sungmin Eum and Doheon Lee and Rohit Shete and Chiao-Yi Wang and Heesung Kwon and Shuvra S. Bhattacharyya},
journal= {arXiv preprint arXiv:2503.22884},
year = {2025}
}
备注
ICCV 2025