可控维度的详细物体描述
计算机视觉与模式识别
2025-01-09 v2
摘要
物体描述在帮助视障人士理解和比较物体差异方面发挥着重要作用。最近的多模态大语言模型 (MLLM) 显示出强大的感知能力,展示出巨大的潜力用于生成以物体为中心的描述。然而,这些模型生成的描述通常包含大量与用户意图不相关的内容,或遗漏某些重要的物体维度细节。在特定场景下,用户可能只需要某些维度的细节。本文提出了一种面向用户指定维度的物体描述细化管道,称为 Dimension Tailor,旨在增强用户指定的细节。该管道包括三个步骤:维度提取、擦除和补充,这些步骤将描述分解为用户指定的维度。Dimension Tailor 不仅可以提高物体细节的质量,还能根据用户偏好灵活地包括或排除特定维度。我们进行了大量实验,以展示 Dimension Tailor 在可控物体描述方面的有效性。值得注意的是,所提出的管道能够持续地提高最新 MLLM 的性能。该代码目前可在 https://github.com/xin-ran-w/ControllableObjectDescription 上获得。
引用
@article{arxiv.2411.19106,
title = {Detailed Object Description with Controllable Dimensions},
author = {Xinran Wang and Haiwen Zhang and Baoteng Li and Kongming Liang and Hao Sun and Zhongjiang He and Zhanyu Ma and Jun Guo},
journal= {arXiv preprint arXiv:2411.19106},
year = {2025}
}
备注
11 pages, 8 figures