编码器架构的实证评估:用于快速实时长对话理解
计算与语言
2025-02-19 v1
摘要
分析长文本数据(如客户通话记录)是一种代价高昂且费时费力的任务。机器学习方法,即 Transformer 模型,被用于建模经理-客户之间的交互。然而,Transformer 具有固定长度的架构,其自注意力机制随输入长度呈二次增长。这种限制使得在实时场景下使用传统 Transformer 处理长序列任务(如对话理解)变得具有挑战性。本文我们探索并评估了最近提出的高效 Transformer 变体(如 Performer、Reformer)以及基于 CNN 的架构,用于实时和准实时长对话理解任务。我们表明,CNN 基于模型在训练速度上约快 2.6 倍,在推理速度上约快 80%,在内存效率上约高出 72%。此外,我们在 Long Range Arena 基准测试上对 CNN 模型进行评估,以展示其在一般长文档分析中的竞争力。
关键词
引用
@article{arxiv.2502.12458,
title = {An Empirical Evaluation of Encoder Architectures for Fast Real-Time Long Conversational Understanding},
author = {Annamalai Senthilnathan and Kristjan Arumae and Mohammed Khalilia and Zhengzheng Xing and Aaron R. Colak},
journal= {arXiv preprint arXiv:2502.12458},
year = {2025}
}