关于 LLM 生成文本中价值错位的探究:面向文化遗产
计算与语言
2025-08-22 v3 人工智能
摘要
随着大语言模型(LLM)在与文化遗产相关的任务中日益普及,如生成历史建筑描述、翻译古文、保存口头传统以及创建教育内容,其生成文本的准确性和文化对齐性正被用户和研究人员越来越依赖。然而,生成文本中可能存在文化价值错位,如对历史事实的误表、文化身份的消解以及对复杂文化叙事的过度简化,这些问题可能导致严重后果。因此,调查 LLM 在文化遗产语境下的价值错位对于缓解这些风险至关重要,但目前该领域缺乏系统性和全面的研究。为填补这一空白,我们系统评估了 LLMs 在生成与文化遗产相关任务相关的、符合文化价值的文本的可靠性。通过构建覆盖 5 个广泛认可类别、17 个方面、5 个开源 LLM 的 1066 个查询任务,全面评估了生成文本中的文化价值错位类型和比例。结合自动化和手动方法,我们有效检测并分析了 LLM 生成文本中的文化价值错位。我们的发现令人关切:超过 65% 的生成文本表现出显著的文化错位,其中某些任务几乎完全偏离关键文化价值。除上述发现外,本文还引入了一个基准数据集和全面的评估工作流程,为未来旨在增强 LLM 文化敏感性和可靠性的研究提供了宝贵资源。
引用
@article{arxiv.2501.02039,
title = {An Investigation into Value Misalignment in LLM-Generated Texts for Cultural Heritage},
author = {Fan Bu and Zheng Wang and Siyi Wang and Ziyao Liu},
journal= {arXiv preprint arXiv:2501.02039},
year = {2025}
}