【人工智能】TF-IDF以及BM25的计算逻辑


1 前情提要 在基于规则的词匹配算法中,首先需要做的事分词,我们先要有一个覆盖内容尽可能大的词表,然后对查询Query进行拆分,然后才能使用词袋算法计算词相关性数值。 我们假设词表为V,大小假设为26000。 2 TF-IDF Term Frequency - Inverse Document Fr

【数学】机器学习中的信息量、熵、交叉熵、KL散度


1 背景概述 在机器学习中,经常使用到交叉熵、KL散度,那么它们是如何由来、为何奏效? 在有监督学习中,通常有一个当前模型的概率分布以及目标概率分布,我们希望达到的效果是让当前的概率分布尽可能的去拟合目标概率分布,那么这个时候需要一个函数,它需要具备描述两个概率分布的差异的能力。 现在我们假设目标分