神谕已言:对Pythia模型对话能力的多维度评估
计算与语言
2025-09-23 v1 人工智能
摘要
对话是大语言模型(LLMs)的标志性能力之一。尽管其普遍存在,但很少有研究真正区分在后训练过程中涌现的、支撑对话行为的特定要素。我们采用了一套全面的基于模型的评估指标,每个指标都针对对话的一个独特细粒度方面,并以语言学理论为指导。我们评估了预训练的Pythia模型在这些维度上的性能如何随模型大小变化,以及作为在对话数据集上进行监督微调的结果。我们观察到,原始模型大小对大多数指标仅有轻微影响,而微调则迅速使除最小测试模型外的所有模型的得分达到饱和。与我们的预期有些相反,许多指标显示出非常相似的趋势,特别是当它们都植根于同一个评估器模型时,这引发了对其在测量特定维度方面可靠性的质疑。为此,我们对生成响应中的分数分布、指标相关性和词频进行了额外分析,以帮助解释我们的观察结果。
引用
@article{arxiv.2509.16487,
title = {The Oracle Has Spoken: A Multi-Aspect Evaluation of Dialogue in Pythia},
author = {Zixun Chen and Petr Babkin and Akshat Gupta and Gopala Anumanchipalli and Xiaomo Liu},
journal= {arXiv preprint arXiv:2509.16487},
year = {2025}
}