AI 中的幽默:大规模众包偏好数据与笑话标题生成基准
机器学习
2024-12-19 v2 人工智能
计算与语言
摘要
我们提出了一个用于创意任务的新型多模态偏好数据集,包含来自过去八年《纽约客》周笑话标题竞赛的2500万以上人类评分,涵盖220万多个标题。该独特数据集支持开发和评估用于幽默标题生成的多模态大语言模型和基于偏好的微调算法。我们提出了用于评估模型生成标题质量的新型基准,利用GPT-4和人类判断建立排序评估策略。我们的实验结果表明,当应用于创意任务时,诸如RLHF和DPO等现有微调方法存在局限。此外,我们展示即使是GPT-4和Claude等最先进模型,也在生成幽默标题方面不及顶级人类选手。作为结束这一大规模数据收集努力,我们将整个偏好数据集发布给研究社区,推动AI幽默生成和评估领域的进一步发展。
引用
@article{arxiv.2406.10522,
title = {Humor in AI: Massive Scale Crowd-Sourced Preferences and Benchmarks for Cartoon Captioning},
author = {Jifan Zhang and Lalit Jain and Yang Guo and Jiayi Chen and Kuan Lok Zhou and Siddharth Suresh and Andrew Wagenmaker and Scott Sievert and Timothy Rogers and Kevin Jamieson and Robert Mankoff and Robert Nowak},
journal= {arXiv preprint arXiv:2406.10522},
year = {2024}
}