兴趣的观念:理解人类和语言模型中数学问题的有趣程度
人工智能
2026-05-29 v2
摘要
数学的演进在很大程度上受到有趣程度的影响:研究人员根据期望的兴趣和挑战性选择要研究的问题,学生根据期望的兴趣和挑战性选择要参与的问题。随着人工智能系统,特别是能够灵活处理自然语言和形式数学的大型语言模型(LLMs),在数学研究和教育中日益受到重视,准确地刻画它们的判断力度与不同背景人群的一致性变得至关重要。我们研究了LLMs是否与人类有趣ness判断一致,通过将LLM评分与两类人群的评分进行比较:一类是来自不同数学背景的众所周知的参与者,另一类是国际数学奥林匹克竞赛选手。尽管许多LLMs在广泛意义上与人类的有趣ness观念一致,但它们在人类判断分布方面大多未能匹配。它们还在为人类寻找问题有趣的原因方面表现较弱,与人类挑选的理由之间的相关性很低。最后,我们评估了LLMs生成有趣问题的能力,发现经过有效性筛选后,LLMs能够生成引人入胜的问题。我们以收获为导师,包括多LLM-人类协作系统的需求,概述了LLMs作为数学推理伙伴的潜力与当前局限性。
引用
@article{arxiv.2511.08548,
title = {A Matter of Interest: Understanding Interestingness of Math Problems in Humans and Language Models},
author = {Shubhra Mishra and Yuka Machino and Gabriel Poesia and Albert Jiang and Joy Hsu and Adrian Weller and Challenger Mishra and David Broman and Joshua B. Tenenbaum and Mateja Jamnik and Cedegao E. Zhang and Katherine M. Collins},
journal= {arXiv preprint arXiv:2511.08548},
year = {2026}
}
备注
Published at the Math-AI Workshop, NeurIPS 2025