中文

Telenor Nordics Customer Service self-help corpus

计算与语言 2026-05-27 v1

摘要

本文介绍了一个由四个北欧电信运营商的公共自助页面收集、经通过结合 LLM 与人工标注管道筛选后过滤出人员可识别信息并确保相关性的多语言客户服务自助语料库。该语料库包含 1,122 份经过人工验证的文档,覆盖芬兰语、丹麦语、挪威语和瑞典语,总计超过一百万个词元。北欧语言的领域特定数据仍稀缺,尤其是在客户服务领域:这是一个在检索增强生成、跨语言迁移学习以及新兴代理驱动服务架构中日益重要的领域。语料库分析揭示了不同运营商之间文档长度和结构存在显著差异,这反映出各自的编辑策略,同时文档主题广泛覆盖网络硬件、移动服务、电视与流媒体、账单以及账户管理。该数据集以 CC-BY-NC-SA-4.0 许可证向公众提供,地址为 https://zenodo.org/records/19493152,旨在支持北欧 NLP 与信息检索领域的可重复研究。

关键词

引用

@article{arxiv.2605.26891,
  title  = {Telenor Nordics Customer Service self-help corpus},
  author = {Mike Riess},
  journal= {arXiv preprint arXiv:2605.26891},
  year   = {2026}
}

备注

8 pages, 2 figures, 5 tables. Submitted to Nordic Machine Intelligence. Dataset: https://zenodo.org/records/19493152