中文

有向域精细调优:为特定训练任务定制独立模态

计算机视觉与模式识别 2024-06-25 v1 人工智能

摘要

大型语言模型(LLMs)和大型视觉语言模型(LVLMs)一直是人工智能领域的前沿,尤其用于文本生成、视频字幕和问答等任务。通常情况下,针对更广泛的知识库或数据集进行训练更为可行,这有助于提高可泛化性、学习主题之间的关系以及识别模式。相反,我们提出为每个模态在特定领域内的每个任务提供指令数据集,然后通过LORA微调模型参数。通过我们的做法,我们可以在消除与给定任务无关的所有噪声的同时,确保模型生成具有增强精度。对于本工作,我们使用Video-LLaVA为烹饪视频(无字幕)生成食谱。Video-LLaVA的多模态架构允许我们为其图像编码器提供烹饪图片,为其视频编码器提供烹饪视频,为其文本编码器提供一般烹饪问题。因此,我们旨在消除与烹饪无关的所有噪声,同时提高模型生成特定食材清单和详细步骤的能力。结果表明,我们的方法通过Video-LLaVA在YouCook2数据集上取得了2%的提升。虽然这看起来是一个边际增加,但我们的模型是在Video-LLaVA规模的2.5%大小的图像指令数据集和23.76%大小的视频指令数据集上训练的。

关键词

引用

@article{arxiv.2406.16346,
  title  = {Directed Domain Fine-Tuning: Tailoring Separate Modalities for Specific Training Tasks},
  author = {Daniel Wen and Nafisa Hussain},
  journal= {arXiv preprint arXiv:2406.16346},
  year   = {2024}
}