中文

开源大语言模型作为多语言众包工作者:在目标语言无示例且无机器翻译的情况下合成多语言开放域对话

计算与语言 2025-03-06 v1 人工智能 人机交互 机器学习

摘要

开放域对话智能体领域的主导范式主要聚焦于英语,涵盖模型和数据集。此外,众包此类数据集所需的财务和时间投入相当可观,特别是在涉及多种语言的情况下。幸运的是,大语言模型(LLMs)的进展揭示了跨多种任务的丰富可能性。具体而言,指令调优使LLMs能够基于自然语言指令执行任务,有时甚至超越人类众包工作者的表现。此外,这些模型具备在单一线程中使用多种语言的能力。因此,为了在不同语言中生成新样本,我们提出利用这些能力来复制数据收集过程。我们引入了一个使用LLMs在多种目标语言中生成开放域对话数据的流水线,并在一种独特的源语言上进行了演示。通过摒弃显式机器翻译,我们增强了对语言特定细微差别的遵循。我们将该方法应用于PersonaChat数据集。为了增强生成对话的开放性并模拟真实场景,我们引入了与对话参与者所参与对话类型对应的语音事件概念,以及表示对话前提的共同基础概念。

关键词

引用

@article{arxiv.2503.03462,
  title  = {Open-Source Large Language Models as Multilingual Crowdworkers: Synthesizing Open-Domain Dialogues in Several Languages With No Examples in Targets and No Machine Translation},
  author = {Ahmed Njifenjou and Virgile Sucal and Bassam Jabaian and Fabrice Lefèvre},
  journal= {arXiv preprint arXiv:2503.03462},
  year   = {2025}
}