中文

面向电话转录文本的实体识别与语言 verbalization 模式的 LingVarBench 基准测试

计算与语言 2026-01-15 v2 人工智能 人机交互 机器学习

摘要

我们研究电话转录文本中的结构化实体抽取,这类文本常见于客户支持和医疗保健领域,标注成本高昂且数据获取受隐私和同意限制。现有方法在处理语病、中断和说话者重叠时性能下降,然而真实电话语料库很少共享。我们引入 LingVarBench,一个基准测试及语义合成数据生成管道,通过 (1) LLM 抽样实体值、(2) 覆盖多样语病和实体特定读出风格的精选语言 verbalization 模式、(3) 价值-转录一致性过滤器,生成语言多样化的训练数据。使用该数据集,DSPy 的 SIMBA 自动合成并优化抽取提示,减少手动提示工程,针对 verbal 变化的鲁棒性。对于真实客户转录,仅基于 LingVarBench 优化的提示在 ZIP 码、出生日期和姓名等结构化实体上(F1 大约 94-95%)超越零样本基线并接近或匹配人工调优提示。对于主观问卷选项,优化后的提示在零样本性能上显著提升,接近人工调优提示。LingVarBench 为直接答复场景中的部署提供了实用且高效的路径,后续可通过真实标注实现进一步优化。

关键词

引用

@article{arxiv.2508.15801,
  title  = {LingVarBench: Benchmarking LLMs on Entity Recognitions and Linguistic Verbalization Patterns in Phone-Call Transcripts},
  author = {Seyedali Mohammadi and Manas Paldhe and Amit Chhabra and Youngseo Son and Vishal Seshagiri},
  journal= {arXiv preprint arXiv:2508.15801},
  year   = {2026}
}

备注

Accepted to EACL 2026 (Industry Track); to appear in the proceedings