中文

用于高亮专利段落的专利情感分析

机器学习 2021-11-19 v1 计算与语言 信息检索

摘要

给定一份专利文档,识别不同的语义标注是一个有趣的研究方向。文本标注有助于审查员和专利律师等专利从业者快速识别任何发明的关键论点,进而实现对专利文本的及时标记。在人工专利分析过程中,为了达到更好的可读性,通过标记段落来识别语义信息是一种惯常做法。这一语义标注过程费力且耗时。为缓解该问题,我们提出了一个新颖的数据集,用于训练机器学习(Machine Learning)算法以自动化高亮过程。本工作的贡献包括:i) 我们通过遍历十年间的USPTO专利,构建了一个规模为15万样本的多分类新颖数据集;ii) 利用必要的探索性数据分析阐明了数据的统计信息与分布;iii) 开发了基线机器学习模型以利用该数据集解决专利段落高亮任务;iv) 与该任务相关的数据集和代码已通过专门的GIT网页开源:https://github.com/Renuk9390/Patent_Sentiment_Analysis;v) 提供了未来利用深度学习和领域特定预训练语言模型扩展本工作以开发高亮工具的路径。本工作协助专利从业者自动高亮语义信息,并借助机器学习的能力助力创建可持续且高效的专利分析。

关键词

引用

@article{arxiv.2111.09741,
  title  = {Patent Sentiment Analysis to Highlight Patent Paragraphs},
  author = {Renukswamy Chikkamath and Vishvapalsinhji Ramsinh Parmar and Christoph Hewel and Markus Endres},
  journal= {arXiv preprint arXiv:2111.09741},
  year   = {2021}
}