人类与LMMs:数字通信中表情符号解读与使用的差异探究
计算机视觉与模式识别
2024-04-16 v2
摘要
利用大型多模态模型(LMMs)模拟人类在处理多模态信息(尤其是在社交媒体背景下)时的行为,因其广泛的潜力和深远的影响而引起了极大兴趣。表情符号作为数字通信中最独特的方面之一,在丰富和澄清情感与语气维度方面至关重要。然而,在理解这些先进模型(如GPT-4V)如何在在线交互的细微语境中解读和使用表情符号方面,存在显著差距。本研究旨在通过考察GPT-4V在复制人类使用表情符号行为方面的表现来弥合这一差距。研究结果揭示了人类与GPT-4V行为之间存在明显差异,这可能是由于人类解读的主观性以及GPT-4V以英语为中心的训练的局限性,暗示了文化偏见和非英语文化代表性不足。
引用
@article{arxiv.2401.08212,
title = {Human vs. LMMs: Exploring the Discrepancy in Emoji Interpretation and Usage in Digital Communication},
author = {Hanjia Lyu and Weihong Qi and Zhongyu Wei and Jiebo Luo},
journal= {arXiv preprint arXiv:2401.08212},
year = {2024}
}
备注
Accepted for publication in ICWSM 2024