MIKO:面向社交媒体常识发现的大语言模型多模态意图知识蒸馏
计算与语言
2024-03-01 v2
摘要
社交媒体已成为与他人联系、了解新闻、表达观点和寻找娱乐的普遍工具。然而,由于社交媒体帖子中意图的隐含性、需要跨模态理解文本和图像,以及存在标签、拼写错误和复杂缩写等噪声信息,理解社交媒体帖子背后的意图仍然具有挑战性。为应对这些挑战,我们提出了MIKO,一个多模态意图知识蒸馏框架,它协同利用大语言模型(LLM)和多模态大语言模型(MLLM)来揭示用户的意图。具体来说,我们使用MLLM解释图像,使用LLM从文本中提取关键信息,最后再次指示LLM生成意图。通过将MIKO应用于公开的社交媒体数据集,我们构建了一个包含137,287条帖子中1,372K个意图的意图知识库。我们进行了两阶段标注以验证生成知识的质量,并评估了广泛使用的LLM在意图生成任务上的性能。我们进一步将MIKO应用于一个讽刺检测数据集,并蒸馏出一个学生模型,以展示应用意图知识的下游收益。
引用
@article{arxiv.2402.18169,
title = {MIKO: Multimodal Intention Knowledge Distillation from Large Language Models for Social-Media Commonsense Discovery},
author = {Feihong Lu and Weiqi Wang and Yangyifei Luo and Ziqin Zhu and Qingyun Sun and Baixuan Xu and Haochen Shi and Shiqi Gao and Qian Li and Yangqiu Song and Jianxin Li},
journal= {arXiv preprint arXiv:2402.18169},
year = {2024}
}
备注
11 pages, 5 figures