中文

GPT-OSS是否就是所有需要的?面向金融智能的大语言模型基准测试与效率悖论

机器学习 2025-12-18 v1

摘要

大语言模型在金融服务领域的快速普及 necessitates 严格的评估框架来评估其性能、效率和实际应用性。本文对GPT-OSS模型族以及当代LLMs在十个多样化金融NLP任务上的表现进行全面评估。通过对GPT-OSS 120B和20B参数变体进行大量实验,我们发现了一个反直觉的发现:更小的GPT-OSS-20B模型在准确率上(65.1% vs 66.5%)与更大模型相当,同时在计算效率方面表现更佳,Token Efficiency Score达到198.4,处理速度为每秒159.80个token[1]。我们的评估使用真实金融数据集(包括Financial PhraseBank、FiQA-SA和FLARE FINERORD)进行情感分析、问答和实体识别任务。我们引入新的效率指标,衡量模型性能与资源利用之间的权衡,为生产环境中的部署决策提供关键见解。基准测试显示,GPT-OSS模型持续优于包括Qwen3-235B在内的更大竞争模型,挑战了模型规模直接与任务性能相关的普遍假设[2]。我们的发现表明,GPT-OSS的架构创新和训练策略使更小的模型能够以显著降低的计算开销实现竞争性能,为金融应用中LLMs的可持续和成本效益部署提供了路径。

关键词

引用

@article{arxiv.2512.14717,
  title  = {Is GPT-OSS All You Need? Benchmarking Large Language Models for Financial Intelligence and the Surprising Efficiency Paradox},
  author = {Ziqian Bi and Danyang Zhang and Junhao Song and Chiung-Yi Tseng},
  journal= {arXiv preprint arXiv:2512.14717},
  year   = {2025}
}