评估LLM在艺术情境中的表现:批评生成与理论心智评估
计算与语言
2025-09-16 v2 计算机与社会
人机交互
摘要
本研究探讨了大型语言模型(LLM)在两个与艺术相关领域的表现:撰写艺术作品评论以及推理关于心智状态(Theory of Mind,或ToM)的艺术情境。对于批评生成部分,我们构建了一个结合Noel Carroll的评估框架和广泛艺术评论理论体系的系统。模型被提示先撰写完整的批评,然后使用逐步提示过程生成更简短且更连贯的版本。这些AI生成的批评随后与人类专家撰写的批评进行了类似图灵测试的评估。许多情况下,人类受试者难以分辨哪个是哪个,结果表明只要谨慎引导,LLM能够产生不仅在风格上合理,又富有解释性的批评。在第二个部分,我们引入了基于涉及解释、情感和道德张力情境的简单ToM任务,这些情境可出现在艺术情境中。这些任务超越了标准的虚假信念测试,允许更复杂、社交嵌入式的推理。我们测试了41个最新的LLM,发现其在不同任务和模型之间的表现存在差异。特别是,涉及情感或模糊情境的任务往往揭示了更明显的差异。综合来看,这些结果有助于阐明LLM如何应对复杂的解释性挑战,揭示了它们的认知局限性与潜力。虽然我们的发现不直接否定所谓的生成式AI悖论——即LLM能够产生类似专家的输出而不具备真实理解——但表明取决于LLM的指令方式,例如通过仔细设计的提示,这些模型可能会比我们原本假设的更接近于表现出类似理解的行为。
引用
@article{arxiv.2504.12805,
title = {Assessing LLMs in Art Contexts: Critique Generation and Theory of Mind Evaluation},
author = {Takaya Arita and Wenxian Zheng and Reiji Suzuki and Fuminori Akiba},
journal= {arXiv preprint arXiv:2504.12805},
year = {2025}
}
备注
Corrected a typo in the metadata title only ("Assesing"->"Assessing"). No changes were made to the PDF or source files