多上下文、大模型,还是道德知识?关于政治文本中撒胡德尔价值检测的系统性研究
计算与语言
2026-05-25 v2 人工智能
机器学习
摘要
检测政治文本中的撒胡德尔价值较为困难,因为隐含线索常常依赖于周围论证且在相邻价值之间存在细粒度区分。我们研究了上下文与显式道德知识对句子级价值检测的作用。采用 ValuesML/Touch\'e ValueEval 格式,我们比较了句子级、窗口级和全文档输入;无检索增强(no-RAG)与检索增强设置(检索精选了道德知识库);监督式 DeBERTa-v3-base/large 编码器;以及 12B 至 123B 参数的零样本大语言模型。实验结果表明,更多上下文并非总是更好:全文档上下文相较于仅用句子输入,使监督式 DeBERTa 编码器在宏平均 F1 分数上提升 3.8-4.8 分,但对零样本 LLM 并不一致。检索到的道德知识在匹配比较中更为有用,提升了每个测试模型家族和上下文条件下的性能,在编码器上,简单地早期融合(early fusion)优于测试的后期融合(late-fusion)和交叉注意力 RAG 变体。按价值分类分析显示,上下文与检索对社交场合或概念混淆的价值帮助最大。这些发现表明,价值敏感的 NLP 应联合评估上下文、知识与模型家族,而非将更长的输入或更大的模型视为普适的改进。
引用
@article{arxiv.2605.22641,
title = {More Context, Larger Models, or Moral Knowledge? A Systematic Study of Schwartz Value Detection in Political Texts},
author = {Víctor Yeste and Paolo Rosso},
journal= {arXiv preprint arXiv:2605.22641},
year = {2026}
}
备注
Code: https://github.com/VictorMYeste/human-value-detection-context-rag, best model: https://huggingface.co/VictorYeste/value-context-rag-deberta-v3-base-doc-rag, 18 pages, 3 figures