中文

LLM 能看见并听见,无需任何训练

计算机视觉与模式识别 2025-01-31 v1 人工智能 计算与语言 机器学习

摘要

我们提出了 MILS:Multimodal Iterative LLM Solver,一种出人意料的简单、无训练的方法,为您最喜欢的 LLM 注入多模态能力。利用其内在的多步骤推理能力,MILS 提示 LLM 生成候选输出,每个候选输出都被评分并迭代反馈,从而最终生成解决方案。这使我们能够实现通常需要在任务特定数据上对专业模型进行训练的各种应用。特别是,我们在涌现的零样本图像、视频和音频描述任务上建立了新的状态突破。MILS 能无缝应用于媒体生成,发现 prompt 改写以改进文本到图像生成,甚至对风格迁移进行编辑 prompt!最后,作为一种无梯度优化方法,MILS 可以将多模态嵌入反向映射到文本,从而实现诸如跨模态算术等应用。

关键词

引用

@article{arxiv.2501.18096,
  title  = {LLMs can see and hear without any training},
  author = {Kumar Ashutosh and Yossi Gandelsman and Xinlei Chen and Ishan Misra and Rohit Girdhar},
  journal= {arXiv preprint arXiv:2501.18096},
  year   = {2025}
}

备注

Code: https://github.com/facebookresearch/MILS