超越复现:用于评估 LLM 文学翻译理解与创造力的配对任务框架
计算与语言
2026-04-21 v1 人工智能
摘要
大语言模型(LLMs)日益用于创意任务,如文学翻译。然而,翻译创造力仍未得到充分探索,且规模评估也很少见,而且源文本理解通常以孤立方式研究,尽管在专业翻译中,理解与创造力紧密交织。在这些缺口之间,我们采用配对任务框架应用于来自 11 本书的文学摘录。任务 1 评估源文本理解,任务 2 通过创意潜能单元(UCPs),如隐喻和文字游戏,对翻译创造力进行评估。我们采用结合专家人工标注与 UCP 基于自动评分的可扩展评估方案,对 23 个模型和四个创意导向提示进行基准测试。我们的发现表明,强大的理解并不等同于人类水平的创造力:模型常常产生字面化或语境不恰当的表述,尤其在更远距离的英汉语言对上差距尤大。创意导向提示仅带来有限的提升,只有一个模型,Mistral-Large,接近人类水平的创造力(0.167 vs. 0.246)。在所有模型-提示组合中,仅有三个超过 0.1 的创造力分数,其余 remain at 或接近零。
引用
@article{arxiv.2604.18169,
title = {Beyond Reproduction: A Paired-Task Framework for Assessing LLM Comprehension and Creativity in Literary Translation},
author = {Ran Zhang and Steffen Eger and Arda Tezcan and Wei Zhao and Simone Paolo Ponzetto and Lieve Macken},
journal= {arXiv preprint arXiv:2604.18169},
year = {2026}
}
备注
Accepted to ACL 2026 Findings