不要停止多方对话!论带约束的合成书面多方对话生成
计算与语言
2026-03-30 v2
摘要
书面多方对话(WMPCs)在多个学科中被广泛研究,社交媒体因其易获取性而成为主要数据源。然而,这些数据集引发了隐私担忧,且往往反映了特定平台的属性。例如,由于僵化的平台结构(如线程、树状讨论),说话者之间的互动可能受到限制,从而产生过于简单的互动模式(如一对一的“回复”链接)。本研究探讨了通过提供对话结构和参与者立场等确定性约束,利用指令微调大语言模型(LLMs)生成合成 WMPCs 的可行性。我们在此背景下研究了两种互补的 LLMs 利用策略: LLMs 作为 WMPC 生成器,即要求 LLM 一次性生成整个 WMPC; LLMs 作为 WMPC 参与方,即在给定对话历史的情况下,LLM 每次生成对话的一个回合(由说话者、受话者和消息组成)。随后,我们引入了一个分析框架,以评估这两种策略对约束的遵从性、内容质量和交互复杂性。最后,我们通过人工评估和 LLM-as-a-judge 评估来衡量所获 WMPCs 的水平。我们发现不同 LLMs 之间存在显著差异,仅有部分模型能够生成高质量的 WMPCs。我们还发现,与一次性生成 WMPCs 相比,逐回合生成能更好地遵从约束并具有更高的语言变异性。尽管如此,我们的结构和定性评估表明,这两种生成策略均能产生高质量的 WMPCs。
引用
@article{arxiv.2502.13592,
title = {Don't Stop the Multi-Party! On Generating Synthetic Written Multi-Party Conversations with Constraints},
author = {Nicolò Penzo and Marco Guerini and Bruno Lepri and Goran Glavaš and Sara Tonelli},
journal= {arXiv preprint arXiv:2502.13592},
year = {2026}
}
备注
Accepted at AAAI2026