从预测到依据:通过强化学习将情感推理对齐人类理由
计算与语言
2026-04-16 v1 人工智能
摘要
虽然基于方面情感分析(ABSA)系统在识别情感极性方面取得了高准确率,但它们常常以“黑箱”形式存在,缺乏人类情感认知所特有的明确推理能力。人类并不仅仅对情感进行分类;他们构建对判断的因果解释。为弥合这一差距,我们提出ABSA-R1,一个大语言模型框架,旨在模拟这种“先推理后预测”的认知过程。通过利用强化学习(RL),ABSA-R1学习如何阐述“为什么”即“是什么”,生成自然语言的依据,为其情感预测提供支撑。我们引入认知对齐奖励模型(原情感感知奖励模型),以确保生成的推理路径与最终情感标签一致。此外,受元认知监控启发,我们实施了基于绩效的拒绝抽样策略,针对模型内部推理不确定或不一致的难题进行选择性处理。实验结果表明,为模型提供这种明确的推理能力不仅提高了可解释性,也在情感分类和三元组抽取方面优于非推理基线方法。
引用
@article{arxiv.2604.13398,
title = {From Prediction to Justification: Aligning Sentiment Reasoning with Human Rationale via Reinforcement Learning},
author = {Shihao Zhang and Ziwei Wang and Jie Zhou and Yulan Wu and Qin Chen and Zhikai Lei and Liyang Yu and Liang Dou and Liang He},
journal= {arXiv preprint arXiv:2604.13398},
year = {2026}
}