中文

可控维度的详细物体描述

计算机视觉与模式识别 2025-01-09 v2

摘要

物体描述在帮助视障人士理解和比较物体差异方面发挥着重要作用。最近的多模态大语言模型 (MLLM) 显示出强大的感知能力,展示出巨大的潜力用于生成以物体为中心的描述。然而,这些模型生成的描述通常包含大量与用户意图不相关的内容,或遗漏某些重要的物体维度细节。在特定场景下,用户可能只需要某些维度的细节。本文提出了一种面向用户指定维度的物体描述细化管道,称为 Dimension Tailor,旨在增强用户指定的细节。该管道包括三个步骤:维度提取、擦除和补充,这些步骤将描述分解为用户指定的维度。Dimension Tailor 不仅可以提高物体细节的质量,还能根据用户偏好灵活地包括或排除特定维度。我们进行了大量实验,以展示 Dimension Tailor 在可控物体描述方面的有效性。值得注意的是,所提出的管道能够持续地提高最新 MLLM 的性能。该代码目前可在 https://github.com/xin-ran-w/ControllableObjectDescription 上获得。

关键词

引用

@article{arxiv.2411.19106,
  title  = {Detailed Object Description with Controllable Dimensions},
  author = {Xinran Wang and Haiwen Zhang and Baoteng Li and Kongming Liang and Hao Sun and Zhongjiang He and Zhanyu Ma and Jun Guo},
  journal= {arXiv preprint arXiv:2411.19106},
  year   = {2025}
}

备注

11 pages, 8 figures