中文

探索多方对话中 MLLMs 的泛化能力:复杂情景下的多语言响应生成

计算与语言 2025-05-20 v2

摘要

当前的多语言大语言模型(MLLMs)仍 focus 于简单问答格式,往往忽略更复杂的对话情景。换言之,多语言大模型的能力尚未在结构复杂的对话任务中得到验证。为此,我们提出三个问题: Q1: LLMs 在更复杂的对话情景中如何泛化?Q2: 在高质量平行基准数据上进行监督微调能否恢复这种能力?Q3:在这种设置下,“多语言互补”效应是否存续?为回答这些问题,我们引入 XMP,一个高质量平行的多语言数据集,源自多方播客对话,这是第一个聚焦于多方对话情景的平行数据集。数据集中大多数样本特征为三位或更多参与者,就广泛的主题进行讨论。通过大量实验,我们发现: R1: MLLMs 在多方情景下未能泛化;R2: 在 XMP 上进行微调仅提升有限,70B 模型最多比其 8B 对手提升 1% 的绝对值;R3: 在 SFT 中混合语言通常是有害的,任何益处都微弱且仅限于 70B 模型中的孤立案例。

关键词

引用

@article{arxiv.2501.11269,
  title  = {Can MLLMs Generalize to Multi-Party dialog? Exploring Multilingual Response Generation in Complex Scenarios},
  author = {Zhongtian Hu and Yiwen Cui and Ronghan Li and Meng Zhao and Lifang Wang},
  journal= {arXiv preprint arXiv:2501.11269},
  year   = {2025}
}