中文

派舍特高阶类别是否助力句子级人类价值检测?分层门控与校准研究

计算与语言 2026-04-08 v3 人工智能 机器学习

摘要

从单句话中检测人类价值是一个稀疏、不平衡的多标签任务。我们研究在ValueEval'24 / ValuesML(74K英文句子)上,基于计算资源有限的预算下,派舍特(Schwartz)高阶(HO)类别是否对这一任务有帮助。我们比较直接监督的变换器、硬性HO→价值管道、Presence→HO→价值级联、紧凑指令微调大型语言模型(LLM)、QLoRA,以及阈值调优和小型集成等低成本升级方案。HO类别是可学习的:最简单的二元对,Growth vs. Self-Protection,达到Macro-F1=0.58。最可靠的提升来自校准和集成:阈值调优使Social Focus vs. Personal Focus从0.41提升至0.57(+0.16),变换器软投票将Growth从0.286提升至0.303,Transformer+LLM混合模型在Self-Protection上达到0.353。相比之下,硬性分层门控未能一致改善最终任务。紧凑型LLM作为独立系统时也落后于监督编码器,尽管在混合集成中有时会提供有用的多样性。在本基准测试中,HO结构更常作为归纳偏置而非刚性路由规则。

关键词

引用

@article{arxiv.2602.00913,
  title  = {Do Schwartz Higher-Order Values Help Sentence-Level Human Value Detection? A Study of Hierarchical Gating and Calibration},
  author = {Víctor Yeste and Paolo Rosso},
  journal= {arXiv preprint arXiv:2602.00913},
  year   = {2026}
}

备注

Code: https://github.com/VictorMYeste/human-value-detection, models: https://huggingface.co/papers/2602.00913, 27 pages, 4 figures