通过以环视指令调优,提升多模态大语言模型对对象姿态理解的能力
计算机视觉与模式识别
2025-04-01 v2 人工智能
摘要
多模态大语言模型(MLLM)是连接人类与 AI 技术的关键接口,在多模态应用中发挥着重要作用。然而,当前的 MLLM 在解释图像中对象姿态方面面临挑战,因为训练数据中的姿态标注不一致,阻碍了建立一致的姿态理解。为克服此困难,我们提出了环视指令调优方法,基于源自用户环视视角的一致标注标准,将 MLLM 的姿态理解与用户的视角一致。我们首先生成环视指令数据,利用 MLLM 识别对象细节的能力,并应用先验知识进行姿态理解。使用该数据进行指令调优,以增强模型对姿态解释的准确能力。此外,我们引入了 EgoOrientBench,这是一个基准测试,旨在评估 MLLM 在三项任务中使用来自不同领域的图像进行姿态理解。在该基准测试上的实验结果表明,环视指令调优显著提升了姿态理解能力,而不会损害整体 MLLM 性能。指令数据和基准数据集已在项目页面 https://github.com/jhCOR/EgoOrientBench 提供。
引用
@article{arxiv.2411.16761,
title = {Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning},
author = {Ji Hyeok Jung and Eun Tae Kim and Seoyeon Kim and Joo Ho Lee and Bumsoo Kim and Buru Chang},
journal= {arXiv preprint arXiv:2411.16761},
year = {2025}
}
备注
CVPR2025 Camera-ready