评估聊天机器人在金融文献中的准确性
人工智能
2025-02-18 v1 计量经济学
摘要
我们评估了两个聊天机器人——ChatGPT(4o和o1-preview版本)和Gemini Advanced——在提供金融文献参考文献和运用新方法方面的可靠性。除了文献中常用的二元方法外,我们还开发了一种非二元方法和新近度度量,以评估幻觉率如何随主题的新近程度而变化。在分析了150条引用后,ChatGPT-4o的幻觉率为20.0%(95%置信区间,13.6%-26.4%),而o1-preview的幻觉率为21.3%(95%置信区间,14.8%-27.9%)。相比之下,Gemini Advanced表现出更高的幻觉率:76.7%(95%置信区间,69.9%-83.4%)。虽然幻觉率随更近期的主题而增加,但这一趋势对Gemini Advanced而言在统计上不显著。这些发现强调了在快速发展的领域中验证聊天机器人提供的参考文献的重要性。
引用
@article{arxiv.2411.07031,
title = {Evaluating the Accuracy of Chatbots in Financial Literature},
author = {Orhan Erdem and Kristi Hassett and Feyzullah Egriboyun},
journal= {arXiv preprint arXiv:2411.07031},
year = {2025}
}