桥接创意理解鸿沟:小规模人类对齐实现 LLM 专家水平的幽默排名
计算与语言
2025-02-28 v1 人工智能
机器学习
摘要
大型语言模型 (LLM) 在理解创意内容方面表现出显著局限性,这一点在 Hessel 等人 (2023) 对纽约客漫画标题竞赛 (NYCCC) 的研究中得到了明确展示。该研究暴露了 LLM 与人类在幽默理解之间的重大差距,确立了理解和评估创意内容是 AI 发展中的关键挑战。我们通过分解幽默理解为三个组成部分并系统性地改进每个环节来重塑这一挑战:通过改进注释提升视觉理解,利用 LLM 生成的幽默推理与解释,以及实施针对性的人类偏好对齐。我们 refined 的方法在标题排名任务中达到了 82.4% 的准确率,显著超过了之前的 67% 基准,匹配了该领域世界顶尖人类专家的性能。值得注意的是,尽管通过各种人格提示尝试模拟子群偏好效果有限,但使用众包偏好数据进行模型微调却非常有效。这些发现表明,LLM 在创意判断方面的局限性可以通过针对特定子群和个体的对齐来有效解决。最后,我们提出实现人工通用智能 (AGI) 需要系统性地收集跨创意领域的人类偏好数据。我们主张,就像人类创意深受个人和文化偏好的影响一样,用多样化的人类偏好数据训练 LLM 可能是发展出真正创意理解能力的关键。
引用
@article{arxiv.2502.20356,
title = {Bridging the Creativity Understanding Gap: Small-Scale Human Alignment Enables Expert-Level Humor Ranking in LLMs},
author = {Kuan Lok Zhou and Jiayi Chen and Siddharth Suresh and Reuben Narad and Timothy T. Rogers and Lalit K Jain and Robert D Nowak and Bob Mankoff and Jifan Zhang},
journal= {arXiv preprint arXiv:2502.20356},
year = {2025}
}