中文

基于 Transformer 的注意力机制与文本挖掘机器翻译上下文建模系统

计算与语言 2025-01-22 v3 人工智能

摘要

本文提出一种基于 Transformer 框架的新型架构方案,创新性地将 K-均值聚类算法融合其中,以增强该架构对文本语境感知能力的水平。Transformer 模型因其并行计算能力和多头注意力机制在机器翻译任务中表现良好。然而,在处理高度复杂的语言结构时,可能遇到语境歧义或忽略局部特征的问题。为规避这一限制,本文引入 K-均值算法,对输入文本中的词汇和短语进行分层,从而促进对局部结构和语言语境智能的更好识别与保留。这种组合方式的优势在于,K-均值可自动发现文本中的主题或概念区域,这些区域可能直接关联翻译质量。因此,本文构建的架构在 Transformer 之前将 K-均值作为前导阶段,并重新校准多头注意力权重,以辅助识别携带相似语义或功能的词汇和短语。这一设计确保在训练阶段,该架构能够更加关注这些聚类所承载的语境智能,而不仅仅是位置信息。

关键词

引用

@article{arxiv.2408.04216,
  title  = {Attention Mechanism and Context Modeling System for Text Mining Machine Translation},
  author = {Yuwei Zhang and Junming Huang and Sitong Liu and Zexi Chen and Zizheng Li},
  journal= {arXiv preprint arXiv:2408.04216},
  year   = {2025}
}