小型语言模型能否处理上下文总结的多轮客户服务问答?基于合成数据的比较评估
计算与语言
2026-05-04 v3 人工智能
摘要
客户服务问答(QA)系统日益依赖于对对话语言的理解。虽然大语言模型(LLM)取得了优异的性能,但其高计算成本和部署限制使其在资源受限的环境中难以实际应用。小型语言模型(SLM)提供了更高效的替代方案,但其在需要对话连续性和上下文理解的场景中效力尚未得到充分探索,尤其是需要保留对话状态的情境总结场景。本研究针对上下文总结的多轮客户服务问答,考察了指令调优的 SLM。我们引入一种基于对话阶段的定性分析,以评估模型在客户服务交互不同阶段的行为。对 9 个指令调优的低参数 SLM 进行评估,与 3 个商业 LLM 进行对比,采用词汇和语义相似性指标以及定性评估(包括人工评估和 LLM 作为评判员的方法)。结果显示,SLM 之间存在显著差异,其中一些模型接近 LLM 性能,而另一些则难以维持对话连续性和语境一致性。这些发现凸显了低参数语言模型在实际客户服务 QA 系统中的潜力与当前局限。
引用
@article{arxiv.2602.00665,
title = {Can Small Language Models Handle Context-Summarized Multi-Turn Customer-Service QA? A Synthetic Data-Driven Comparative Evaluation},
author = {Lakshan Cooray and Deshan Sumanathilaka and Pattigadapa Venkatesh Raju},
journal= {arXiv preprint arXiv:2602.00665},
year = {2026}
}
备注
Submission Accepted at Frontiers in Artificial Intelligence, Natural Language Processing Section