中文

Call2Instruct:从呼叫中心录音生成LLM微调Q&A数据集的自动化管道

机器学习 2026-01-22 v1 人工智能 计算与语言 人机交互 声音 音频与语音处理

摘要

大型语言模型(LLM)适应特定领域依赖于高质量的微调数据集,尤其是以指令格式(如问答-Q&A)为目标。然而,生成这些数据集尤其是从非结构化来源如呼叫中心音频录音中生成,由于数据的嘈杂和不条理性,面临重大挑战。本文提出了一种解决方案,通过提供一个从此类录音生成问答指令数据集的端到端自动化管道。开发的方法包括依次进行的音频处理(包括语音识别、降噪和自动转录)、文本处理(清洗、规范化和匿名化)、使用向量嵌入从客户需求和随之而来的响应中进行语义提取,以及通过语义搜索进行匹配以形成最终的问答对。结果成功实现了整个管道,生成了专为指令微调格式的数据集。通过对基于Llama 2 7B的LLM模型进行成功微调,验证了所生成数据集的实际价值和可行性。该论文的结论表明,所提出的方法可行,用于将呼叫中心的非结构化对话数据转换为训练LLM的有价值资源。该发展有望为在客户服务领域创建更有效的AI系统提供Q&A任务。开发的代码已公开,以促进可重复性和未来研究。

关键词

引用

@article{arxiv.2601.14263,
  title  = {Call2Instruct: Automated Pipeline for Generating Q&A Datasets from Call Center Recordings for LLM Fine-Tuning},
  author = {Alex Echeverria and Sávio Salvarino Teles de Oliveira and Fernando Marques Federson},
  journal= {arXiv preprint arXiv:2601.14263},
  year   = {2026}
}

备注

15 pages, 1 figures, conference