ChatGPT 研究评价:是否存在年龄、国家、长度或领域偏见?
数字图书馆
2024-11-18 v1
摘要
一些研究表明,ChatGPT 可以根据期刊文章的标题和摘要估计其质量。这使得结合基于引用的公式使用 ChatGPT 质量评分以支持同行评审和研究评价成为可能。然而,尽管 ChatGPT 会撰写报告来支持其评分,其内部过程实际上是不透明的,且其偏见未知。本文探讨发表年份和领域是否为偏倚因素。基于向 ChatGPT 4o-mini 提交一组 117,650 篇来自 26 个领域、发表于 2003、2008、2013、2018 和 2023 年的单学科期刊平衡文章,结果显示平均评分随时间增加,这并非由于作者国籍或标题和摘要长度变化所致。结果在不同领域和第一作者国家之间也存在显著差异。此外,摘要较长的文章倾向于获得更高评分,但这可能是因为这些文章本身质量更好,而非因为 ChatGPT 分析了更多文本。因此,为获得最准确的 ChatGPT 研究质量评价结果,重要的是对 ChatGPT 评分按领域和年份进行归一化,并检查由短摘要文章集合引起的异常。
引用
@article{arxiv.2411.09768,
title = {Research evaluation with ChatGPT: Is it age, country, length, or field biased?},
author = {Mike Thelwall and Zeyneb Kurt},
journal= {arXiv preprint arXiv:2411.09768},
year = {2024}
}