中文

超越正确性:跨文化主观写作偏好评估

计算与语言 2026-01-29 v2 人工智能

摘要

当前的偏好学习方法在标准基准测试上实现高准确率,但在移除客观质量信号后表现显著下降。我们引入 WritingPreferenceBench,这是一个包含 1,800 对人工标注的偏好数据集(1,200 份英文,600 份中文),覆盖 8 个创意写作类型,其中响应在客观正确性、事实准确性和长度上匹配。在此基准上,基于序列的奖励模型——即 RLHF 的标准架构——仅实现 52.7% 的平均准确率,而零样本语言模型判断器表现为 53.9%。相比之下,产生显式推理链的生成式奖励模型实现了 81.8% 的准确率。我们观察到不同写作类型的模型在内部方差较大:单个模型在不同写作类别上的准确率从 18.2% 到 81.8% 不等,平均标准差为 10.1%。这种方差在模型规模方面持续存在,27B 参数模型在 8B 变体上没有一致的改进。我们的结果表明,当前的 RLHF 方法主要学习检测客观错误,而非捕捉主观质量偏好(如创造力、文体技巧和情感共鸣),而成功的偏好建模可能需要中间推理表示而非直接分类。

关键词

引用

@article{arxiv.2510.14616,
  title  = {Beyond Correctness: Evaluating Subjective Writing Preferences Across Cultures},
  author = {Shuangshuang Ying and Yunwen Li and Xingwei Qu and Xin Li and Sheng Jin and Minghao Liu and Zhoufutu Wen and Xeron Du and Tianyu Zheng and Yichi Zhang and Letian Ni and Yuyang Cheng and Zhenzhu Yang and Qiguang Chen and Jingzhe Ding and Shengda Long and Wangchunshu Zhou and Jiazhan Feng and Wanjun Zhong and Libo Qin and Ge Zhang and Wenhao Huang and Wanxiang Che and Chenghua Lin},
  journal= {arXiv preprint arXiv:2510.14616},
  year   = {2026}
}