中文

越南大语言模型的客户支持基准数据集与评估框架

计算与语言 2025-07-31 v1

摘要

随着人工智能的快速发展,大语言模型(LLM)已成为问答(QA)系统中必不可少的工具,提高了客户服务效率,减少了人力负担。越南 LLM(ViLLM)的出现凸显了轻量级开源模型作为实际选择的优势,由于其在准确率、效率和隐私方面的优势。然而,领域特定的评估仍有限,缺乏反映真实客户互动的基准数据集,使得企业难以为支持应用选择合适的模型。为此,我们引入了客户支持对话数据集(CSConDa),该数据集由来自大越南软件公司与人类顾问进行的真实交互中提炼的超过 9000 条 QA 对组成的精选基准。涵盖定价、产品可用性和技术故障排查等多样化主题,CSConDa 为在实际场景中评估 ViLLM 提供了代表性基准。我们进一步提出了全面的评估框架,对 CSConDa 上的 11 个轻量级开源 ViLLM 进行评估,采用自动指标和句法分析揭示模型的优势、劣势及语言模式。本研究提供了模型行为洞察,解释了性能差异,并确定了关键改进领域,支持下一代 ViLLM 的开发。通过建立稳健的基准和系统化评估,我们的工作为客户服务 QA 和越南 LLM 研究提供了明智的模型选择,推动了相关研究的进展。该数据集已公开发布于 https://huggingface.co/datasets/ura-hcmut/Vietnamese-Customer-Support-QA。

关键词

引用

@article{arxiv.2507.22542,
  title  = {A Benchmark Dataset and Evaluation Framework for Vietnamese Large Language Models in Customer Support},
  author = {Long S. T. Nguyen and Truong P. Hua and Thanh M. Nguyen and Toan Q. Pham and Nam K. Ngo and An X. Nguyen and Nghi D. M. Pham and Nghia H. Nguyen and Tho T. Quan},
  journal= {arXiv preprint arXiv:2507.22542},
  year   = {2025}
}

备注

Under review at ICCCI 2025