中文

使用孪生神经网络的嵌入层与相似度分数分析

计算与语言 2024-01-02 v1 机器学习

摘要

大型语言模型(LLM)在从语言理解和写作到应用开发辅助等多种用例中越来越受欢迎。LLM最佳功能的最重要方面之一是嵌入层。词嵌入是单词在连续向量空间中的分布式表示。在LLM的背景下,输入文本中的单词或标记使用模型特定的独特算法转换为高维向量。我们的研究考察了行业领先公司(如OpenAI、Google的PaLM和BERT)的嵌入算法。使用医学数据,我们分析了每个嵌入层的相似度分数,观察到每个算法之间的性能差异。为了增强每个模型并提供额外的编码层,我们还实现了孪生神经网络。在观察到添加模型后性能变化后,我们测量了每个训练周期的碳足迹。与大型语言模型(LLM)相关的碳足迹是一个重要问题,在选择各种用例的算法时应予以考虑。总体而言,我们的研究比较了不同领先嵌入算法的准确性和碳足迹,从而对每个嵌入算法进行了全面评估。

关键词

引用

@article{arxiv.2401.00582,
  title  = {An Analysis of Embedding Layers and Similarity Scores using Siamese Neural Networks},
  author = {Yash Bingi and Yiqiao Yin},
  journal= {arXiv preprint arXiv:2401.00582},
  year   = {2024}
}

备注

10 pages, 11 figures