中文

在语言空间中理解社交媒体跨模态话语

多媒体 2023-02-28 v1 计算与语言 社会与信息网络

摘要

带有文本与图像的多媒体交流在社交媒体上十分流行。然而,关注人类认知中图像如何与文本结构化以形成连贯意义的研究有限。为填补此空白,我们提出跨模态话语这一新概念,反映人类读者如何耦合图像与文本理解。在多媒体语境中,首先从图像导出文本描述(称为字幕)。进一步采用五个标签——实体级插入、投射与具体化,以及场景级重述与扩展——来塑造字幕与文本的结构并呈现其联合意义。作为一项试点研究,我们还构建了首个包含16K条带人工标注话语标签的多媒体推文的数据集。实验结果表明,基于带字幕的多头注意力多媒体编码器能够取得最先进的结果。

关键词

引用

@article{arxiv.2302.13311,
  title  = {Understanding Social Media Cross-Modality Discourse in Linguistic Space},
  author = {Chunpu Xu and Hanzhuo Tan and Jing Li and Piji Li},
  journal= {arXiv preprint arXiv:2302.13311},
  year   = {2023}
}

备注

EMNLP 2022 Findings