中文

基于图注意力网络的特征融合与多模态专利文本研究

机器学习 2025-05-27 v1 信息检索

摘要

针对专利文本语义挖掘中跨模态特征融合、长文本建模效率低以及缺乏层次语义连贯性等问题,本研究提出了 HGM-Net,一个集成了层次对比学习(HCL)、多模态图注意力网络(M-GAT)和多粒度稀疏注意力(MSA)的深度学习框架。该框架通过 HCL 在词、句和段落层次上构建动态掩码、对比和跨结构相似性约束。HCL 在词和段落层级构建对比与跨结构相似性约束,以增强专利文本的局部语义与全局主题一致性;M-GAT 将专利分类码、引证关系和文本语义建模为异构图结构,并通过跨模态门控注意力实现多源特征的动态融合;MSA 采用层次稀疏策略,在词、短语、句子和段落粒度上优化长文本建模的计算效率。实验表明,该框架在专利分类和相似性匹配等任务上相比现有深度学习方法展现出显著优势,为解决专利审查效率提升和技术相关性挖掘问题提供了兼具理论创新与实用价值的方案。

关键词

引用

@article{arxiv.2505.20188,
  title  = {Research on feature fusion and multimodal patent text based on graph attention network},
  author = {Zhenzhen Song and Ziwei Liu and Hongji Li},
  journal= {arXiv preprint arXiv:2505.20188},
  year   = {2025}
}