中文

C2F-Thinker:基于提示引导的粗到细推理强化学习用于多模态情感分析

计算与语言 2026-04-14 v2 人工智能

摘要

多模态情感分析旨在整合文本、语音和视觉信息以实现深层情感理解。尽管通过监督微调取得了进展,但多模态大型语言模型(MLLM)的“黑箱”本质阻碍了可解释性。链律推理(Chain-of-Thought, CoT)虽提供了潜在解决方案,但受限于高昂的手动标注成本以及强化学习(RL)固有的奖励稀疏和稀疏探索效率问题。本文提出 C2F-Thinker 框架,融合粗到细结构化推理与提示引导 RL,构建两阶段渐进式训练管道。第一阶段,我们采用来自大型教师模型提炼的高质量 CoT 数据进行 cold-start 监督微调,包含三个 distinct 阶段:极性判断、中间分析和细粒度评分。这为基础模型构建结构化情感推理范式。第二阶段,我们引入提示引导的群体相对策略优化(Group Relative Policy Optimization, GRPO)算法。通过在抽样过程中注入正确的初始极性预测作为提示,模型被引导至准确的推理路径,从而有效缓解级联错误并提升稀有样本的利用率。此外,设计了多维度奖励函数,集成分类、回归和格式约束,以细化预测精度同时保持可解释性。实验结果表明,C2F-Thinker 在细粒度情感回归任务上实现了与基线相当的性能,同时在跨域泛化方面显著优于基线。这凸显了其在构建可靠且稳健情感分析系统方面的潜力。

关键词

引用

@article{arxiv.2604.00013,
  title  = {C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis},
  author = {Miaosen Luo and Zhenhao Yang and Jieshen Long and Jinghu Sun and Yichu Liu and Sijie Mai},
  journal= {arXiv preprint arXiv:2604.00013},
  year   = {2026}
}