文本之外的视野:多模态训练增强 LLM 的真实性与伦理水平
计算与语言
2023-09-14 v1 人工智能
计算机视觉与模式识别
计算机与社会
机器学习
摘要
多模态大语言模型(MLLM)基于大语言模型(LLM)训练,具备增强的理解多模态输入并生成文本回复的能力。尽管它们在多模态任务上表现出色,MLLM 的纯 NLP 能力常被低估且未经测试。在本研究中,我们跳出常规,揭示了 MLLM 一个有趣的特性——我们的初步结果表明,视觉指令微调(一种将 LLM 转为 MLLM 的流行策略)出人意料且有趣地帮助模型在纯 NLP 语境中同时获得改进的真实性与伦理对齐。例如,一个视觉指令微调的 LLaMA2 7B 模型在 TruthfulQA-mc 和 Ethics 基准上超越了使用超百万人类标注微调的 LLaMA2-chat 7B 模型。进一步分析表明,这种改进的对齐可归因于视觉-文本数据固有的更优指令质量。我们在 github.com/UCSC-VLAA/Sight-Beyond-Text 发布代码,期望促进对视觉-文本协同以及更广泛地多模态交互在对齐研究中的内在价值的进一步探索。
引用
@article{arxiv.2309.07120,
title = {Sight Beyond Text: Multi-Modal Training Enhances LLMs in Truthfulness and Ethics},
author = {Haoqin Tu and Bingchen Zhao and Chen Wei and Cihang Xie},
journal= {arXiv preprint arXiv:2309.07120},
year = {2023}
}