中文

编码器架构的实证评估:用于快速实时长对话理解

计算与语言 2025-02-19 v1

摘要

分析长文本数据(如客户通话记录)是一种代价高昂且费时费力的任务。机器学习方法,即 Transformer 模型,被用于建模经理-客户之间的交互。然而,Transformer 具有固定长度的架构,其自注意力机制随输入长度呈二次增长。这种限制使得在实时场景下使用传统 Transformer 处理长序列任务(如对话理解)变得具有挑战性。本文我们探索并评估了最近提出的高效 Transformer 变体(如 Performer、Reformer)以及基于 CNN 的架构,用于实时和准实时长对话理解任务。我们表明,CNN 基于模型在训练速度上约快 2.6 倍,在推理速度上约快 80%,在内存效率上约高出 72%。此外,我们在 Long Range Arena 基准测试上对 CNN 模型进行评估,以展示其在一般长文档分析中的竞争力。

关键词

引用

@article{arxiv.2502.12458,
  title  = {An Empirical Evaluation of Encoder Architectures for Fast Real-Time Long Conversational Understanding},
  author = {Annamalai Senthilnathan and Kristjan Arumae and Mohammed Khalilia and Zhengzheng Xing and Aaron R. Colak},
  journal= {arXiv preprint arXiv:2502.12458},
  year   = {2025}
}