中文

MuseScorer:大规模创意想法原创性评分

计算与语言 2025-09-22 v2

摘要

对想法原创性进行客观且经验证的评分方法,是通过衡量每个想法在群体中统计上罕见度——这一方法长期用于创造力研究。然而,计算这些频率需要手动对想法的重新表述进行分箱,这一过程主观、费力、易出错且在大规模下脆弱。我们引入 MuseScorer,一个完全自动化、经心理学验证的原创性评分系统。MuseScorer 将大型语言模型 (LLM) 与外部调度检索相集成:给定新想法后,检索语义相似的先前想法分箱,并零样本提示 LLM 判断该想法是否适合现有分箱或形成新分箱。这些分箱无需人工标注即可实现基于频率的原创性评分。在 5 个数据集(Nparticipants=1143N_{participants}=1143nideas=16,294n_{ideas}=16,294)上,MuseScorer 在想法聚类结构(AMI = 0.59)和参与者水平评分(r=0.89r = 0.89)上与人类标注员保持一致,同时表现出强大的收敛性和外部有效性。该系统支持创造力研究中的可扩展、意图敏感且与人类一致的原创性评估。

关键词

引用

@article{arxiv.2505.16232,
  title  = {MuseScorer: Idea Originality Scoring At Scale},
  author = {Ali Sarosh Bangash and Krish Veera and Ishfat Abrar Islam and Raiyan Abdul Baten},
  journal= {arXiv preprint arXiv:2505.16232},
  year   = {2025}
}