OrderChain:面向激发 MLLM 序数理解能力的通用指令调优范式
摘要
尽管多模态大语言模型 (Multimodal Large Language Model, MLLM) 在各方面取得了显著进展,但它们仍面临在序数回归 (Ordinal Regression, OR;即序数分类) 方面取得竞争性能的挑战。为此,本文提出了 OrderChain,一种新型且通用的提示范式,通过 specificity 和 commonality 建模来提高 MLLM 的序数理解能力。具体而言,OrderChain 包括一组任务感知提示,用于促进对多样化 OR 任务的特定性建模,以及一种新的范围优化链式思维 (Range Optimization Chain-of-Thought, RO-CoT),通过统一将其分解为多个小范围优化子任务来学习 OR 任务的 commonality 思维方式。进一步,我们提出了类别递归划分 (Category Recursive Division, CRD) 方法,以生成支持 RO-CoT 自动优化的指令候选类别提示。广泛的实验结果表明,使用我们的 OrderChain 的 LLaVA 模型在多样化 OR 数据集上显著优于基线 LLaVA,例如在 Adience 数据集进行年龄估计时准确率从 47.5% 提升至 93.2%,在糖尿病视网膜病变数据集上准确率从 30.0% 提升至 85.7%。值得注意的是,使用我们的 OrderChain 的 LLaVA 在 Adience 数据集上的准确率比最先进的方法高出 27个百分点,平均绝对误差 (MAE) 提高 0.24。据我们所知,OrderChain 是首个为 OR 任务增强 MLLM 的工作,而其有效性在广泛的 OR 数据集上得到了验证。项目页面:https://order-chain.github.io/。
引用
@article{arxiv.2504.04801,
title = {OrderChain: Towards General Instruct-Tuning for Stimulating the Ordinal Understanding Ability of MLLM},
author = {Jinhong Wang and Shuo Tong and Jian liu and Dongqi Tang and Weiqiang Wang and Wentong Li and Hongxia Xu and Danny Chen and Jintai Chen and Jian Wu},
journal= {arXiv preprint arXiv:2504.04801},
year = {2025}
}
备注
Accepted by ICCV 2025