一种统一框架统一处理多模态任务:基于LLM的神经调谐
计算机视觉与模式识别
2025-08-26 v3 多媒体
摘要
大规模模型在自动化医疗服务和智能客户支持等多个领域展现出卓越能力。然而,由于大多数大模型是在单一模态语料上训练的,因此使其有效处理和理解多模态信号仍是一大挑战。当前研究常针对特定任务或特定场景设计调谐策略,限制了其可扩展性和通用性。为此,我们提出一种统一框架,同时处理多个任务和模态。在该框架中,所有模态和任务被表示为统一标记,采用单一、一致的方法进行训练。为实现高效的多任务处理,我们引入一种新颖的调谐策略,称为神经调谐,灵感来自人类大脑中稀疏分布表示的概念,即仅激活特定子集神经元以完成每个任务。此外,为推动多模态和多任务学习研究,我们提出了新的基准MMUD,其中包含标注了多个任务标签的样本,涵盖推理分段、指涉分段、图像描述和文本到图像生成等任务。通过在MMUD基准上对预训练大模型进行神经调谐,我们展示了能够以简洁高效的方式同时处理多个任务。所有模型、代码和数据集将在公开发布后公开,旨在促进该领域的进一步研究与创新。
引用
@article{arxiv.2408.03001,
title = {One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning},
author = {Hao Sun and Yu Song and Jiaqing Liu and Jihong Hu and Yen-Wei Chen and Lanfen Lin},
journal= {arXiv preprint arXiv:2408.03001},
year = {2025}
}