面向多模态智能的下一词预测:综合综述
计算与语言
2024-12-31 v2 人工智能
计算机视觉与模式识别
机器学习
多媒体
音频与语音处理
摘要
在自然语言处理领域的语言建模基础上,下一词预测(NTP)已演变为一种跨多种模态的机器学习任务中灵活的训练目标,取得了显著成功。随着大型语言模型(LLM)不断进步,将理解与生成任务统一于文本模态,近期研究表明,来自不同模态的任务也能有效地纳入NTP框架,通过将多模态信息转化为标记并基于上下文预测下一个标记。本综述通过NTP的视角引入了一种综合分类法,统一了多模态学习中的理解与生成。该分类法涵盖五个关键方面:多模态分词、MMNTP模型架构、统一任务表示、数据集与评估以及开放挑战。这种新的分类旨在帮助研究人员探索多模态智能。此外,一个收集最新论文与仓库的GitHub仓库已公开,地址为https://github.com/LMM101/Awesome-Multimodal-Next-Token-Prediction
引用
@article{arxiv.2412.18619,
title = {Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey},
author = {Liang Chen and Zekun Wang and Shuhuai Ren and Lei Li and Haozhe Zhao and Yunshui Li and Zefan Cai and Hongcheng Guo and Lei Zhang and Yizhe Xiong and Yichi Zhang and Ruoyu Wu and Qingxiu Dong and Ge Zhang and Jian Yang and Lingwei Meng and Shujie Hu and Yulong Chen and Junyang Lin and Shuai Bai and Andreas Vlachos and Xu Tan and Minjia Zhang and Wen Xiao and Aaron Yee and Tianyu Liu and Baobao Chang},
journal= {arXiv preprint arXiv:2412.18619},
year = {2024}
}
备注
69 papes, 18 figures, repo at https://github.com/LMM101/Awesome-Multimodal-Next-Token-Prediction