中文

合成虚拟律师:面向印度语言多样化司法管辖区的多人格演讲生成框架

计算与语言 2026-02-13 v1

摘要

法律倡导需要权威语气、适时停顿以强调重点以及情感智慧的独特组合。本研究考察了 Gemini 2.5 Flash TTS 与 Gemini 2.5 Pro TTS 模型在生成印度五种语言(泰米尔语、泰卢固语、孟加拉语、印地语和古地亚拉文)合成法庭演讲性能。我们提出一种提示框架,利用 Gemini 2.5 对 5 种语言的原生支持及其上下文感知的节奏,生成具有不同律师人格的演讲。大型语言模型的演进已将文本到语音(TTS)技术的关注力从基本可读性转向情境感知、富有表达性的合成。法律领域的合成语音必须传递权威感和特定的专业人格,这在印度语言多样化的语境下变得更为复杂。该模型表现出“权威单调”特征,擅长程序化信息传递,但在捕捉动态声部变化和情感厚重方面仍有不足。孟加拉语和古地亚拉文的表现进一步凸显了未来改进的语音学前沿。本研究彰显了多语言 TTS 在程序化法律任务中的成熟水平,同时指出在复制人类法律论述的说服艺术方面仍面临挑战。代码地址:https://github.com/naturenurtureelite/Synthesizing-the-Virtual-Advocate/tree/main

关键词

引用

@article{arxiv.2602.11172,
  title  = {Synthesizing the Virtual Advocate: A Multi-Persona Speech Generation Framework for Diverse Linguistic Jurisdictions in Indic Languages},
  author = {Aniket Deroy},
  journal= {arXiv preprint arXiv:2602.11172},
  year   = {2026}
}