Crowd Score:一种使用大语言模型AI投票者作为评委的笑话评估方法
人工智能
2022-12-22 v1
摘要
本文提出了Crowd Score,一种使用大语言模型(LLM)作为AI评委来评估笑话趣味性的新颖方法。我们的方法依赖于向LLM诱导不同的人格,并将AI评委的投票聚合为单一分数来对笑话进行评分。我们使用一种审计技术验证了投票,该技术利用LLM检查针对特定投票的解释是否合理。我们在一个由四种不同幽默类型(亲和型、自我提升型、攻击型和自我挫败型)的四个AI投票者组成的群体中对52个笑话测试了我们的方法。我们的结果表明,在投票问题上,少样本提示比零样本能带来更好的结果。人格诱导表明,对于一组攻击型/自我挫败型笑话,攻击型和自我挫败型投票者比亲和型和自我提升型投票者更倾向于发现更多的笑话好笑。Crowd Score遵循与人类评委相同的趋势,对人类评委认为更好笑的笑话给出更高的分数。我们相信,我们的方法可以应用于其他创意领域,如故事、诗歌、标语等。它既可以帮助采用一种灵活且准确的标准方法,在共同指标下比较计算创意(CC)社区中的不同作品,又可以通过最小化人类在评估创意作品时的参与,加速创意作品的原型设计并降低雇佣人类参与者对创意作品进行评分的成本。
引用
@article{arxiv.2212.11214,
title = {Crowd Score: A Method for the Evaluation of Jokes using Large Language Model AI Voters as Judges},
author = {Fabricio Goes and Zisen Zhou and Piotr Sawicki and Marek Grzes and Daniel G. Brown},
journal= {arXiv preprint arXiv:2212.11214},
year = {2022}
}
备注
11 pages, 3 figures