中文

基于大语言模型的两阶段上下文学习用于气候变化的多模态立场检测

计算机视觉与模式识别 2025-09-11 v1 计算机与社会

摘要

随着数字平台上信息的快速传播,立场检测已成为社交媒体分析中的一个关键挑战。虽然大多数现有方法仅关注文本数据,但现实世界中的社交媒体内容越来越多地结合文本与视觉元素,催生了对先进多模态方法的需求。为填补这一空白,我们提出了一种多模态立场检测框架,通过层次化融合方法整合文本和视觉信息。我们的方法首先利用大语言模型从源文本中检索与立场相关的摘要,同时利用领域感知的图像描述生成器在目标主题的语境下解释视觉内容。这些模态随后通过一个专门的Transformer模块与回复文本联合建模,捕捉文本与图像之间的交互。所提出的模态融合框架整合了多种模态以实现鲁棒的立场分类。我们在MultiClimate数据集上评估了我们的方法,该数据集是面向气候变化相关立场检测的基准,包含对齐的视频帧和转录文本。我们分别取得了76.2%的准确率、76.3%的精确率、76.2%的召回率和76.2%的F1分数,超越了现有的最先进方法。

关键词

引用

@article{arxiv.2509.08024,
  title  = {Two Stage Context Learning with Large Language Models for Multimodal Stance Detection on Climate Change},
  author = {Lata Pangtey and Omkar Kabde and Shahid Shafi Dar and Nagendra Kumar},
  journal= {arXiv preprint arXiv:2509.08024},
  year   = {2025}
}