中文

板球运动员画像:利用文本解说数据解析优势与劣势

机器学习 2023-11-14 v1 计算与语言

摘要

在板球中制定针对特定选手的策略,需要细致理解每位选手独特的优势与劣势。然而,缺乏从板球运动员中提取此类见解的确定性计算方法,构成了重大挑战。本文试图通过建立计算模型来填补这一空白,这些模型旨在提取支配选手优势与劣势的规则,从而促进为个体选手制定量身定制的策略。该工作的复杂性在于几个关键方面:合适数据集的选择、优势与劣势规则的精确定义、适当学习算法的识别,以及所推导规则的验证。为应对这些挑战,我们提出利用非结构化数据,特别是板球文本解说,作为构建板球选手全面优势与劣势规则的宝贵资源。我们还引入了用于构建这些规则的计算可行定义,并提出了一种用于规则构建过程的降维技术。为展示该方法的实用性,我们利用超过一百万条文本解说的庞大语料库,对板球选手的优势与劣势进行了深入分析。此外,我们通过两种不同方法(内在与外在)验证了所构建的规则。本研究的结果公开可用,包括所收集的数据、源代码以及超过250名板球选手的结果,可访问 https://bit.ly/2PKuzx8。

关键词

引用

@article{arxiv.2311.06818,
  title  = {Cricket Player Profiling: Unraveling Strengths and Weaknesses Using Text Commentary Data},
  author = {Swarup Ranjan Behera and Vijaya V. Saradhi},
  journal= {arXiv preprint arXiv:2311.06818},
  year   = {2023}
}

备注

The initial work was published in the ICMLA 2019 conference