首先将所有在历次舆情中出现在相关账号中用户的数据信息进行有效划分,操作步骤如下:
步骤一:获得数据样本X={x1,x2,…,xn};
步骤二:计算xi到其k邻域xki的距离d(xi,xki);计算全部样本点到k邻域的平均值
步骤三:计算数据的密度的公式如式……
步骤四:得到数据的判定函数如式……
步骤五:重复步骤二到步骤四,直到把异常信息全部删除掉。
网友们都要疯了,这尼玛得罪谁也别得罪学霸,否则连人家说的话都看不懂。
继续下翻,网友们终于松了一口气。
因为第34个PPT截图的标题是“以鹰眼观察为例”。
然而,网友高兴的太早了,因为除了周默列出的密密麻麻的ID号以及谁都看不懂的数据外,唯一能看懂的只有几行字。
步骤一:建立对象矩阵X和聚类数N;
步骤二:高度重叠对象作为聚类中心;
步骤三:利用k均值算法计算相似度。以“鹰眼观察”关注的其他用户信息生成关系图如图所示。其中计算对象相似度的公式如式……
步骤四:用各个类的平均向量更新聚类中心,再把每一个对象分别和这n个聚集中心的距离做比较,把相近的分为一类;
步骤五:不断的重复步骤三到步骤四,直到满足终止条件为止。
第50章 来自数学天才的反击(6/8)