JuICE:用于评估 LLM-Judge 识别文化错误的基准
计算与语言
2026-05-27 v1 人工智能
摘要
随着大型语言模型 (LLM) 被部署到全球用户中,它们被集成到来自不同文化背景的用户日常任务中,从撰写个人沟通到头脑风暴创意构思等。这些任务本质上是文化性的:它们需要语境上的恰当性、象征共鸣以及本土说话者无意识依赖的隐性文化期望,意味着即使在事实上合理,却对当地读者而言明显错误。现有文化基准将文化视为通过事实验证或规范蕴涵等方法处理的平坦事实集合,并且采用 LLM 作为裁判器而未检验其是否能够捕捉此类深层文化错误。为填补这一空白,我们提出 JuICE (LLM-Judge 在识别文化错误方面的基准),一个包含 7470 条跨语言注释的多语言数据集,用于标注长篇 LLM 回应中的文化和语言错误。它覆盖来自美国、韩国、印度尼西亚和孟加拉国的 1050 对查询-响应对,包含英文及各国主要语言。使用 JuICE,我们发现即使是最强大的 LLM-judge 在错误片段检测任务中也仅能实现 0.52 的 F1 分数。此外,LLM-judge 持续忽略当地居民轻易识别的深层文化错误。我们的发现表明,健全的文化评估必须超越表面级检测,转向能够考虑文化意义深度与情境性的框架。
引用
@article{arxiv.2605.26955,
title = {JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors},
author = {Jiho Jin and Junho Myung and Juhyun Oh and Junyeong Park and Rifki Afina Putri and Sunipa Dev and Vinodkumar Prabhakaran and Alice Oh},
journal= {arXiv preprint arXiv:2605.26955},
year = {2026}
}