互联网上的每一个网页都可以看作一个顶点每一个顶点都有出度和入度。出度是指从这个网页能链接到的其他网页的数目入度是指能链接到这个网页的其他网页的数目。
这样整个互联网中的所有网页的链接关系可以看成具有大量网页结点的有向图。一个网页很重要最直观的感受就是有许多的网页链接到它即它的入度大并且重要性越高的网页链接它更能说明它越重要。
基于以上思想我们首先量化网页的重要性用PR值表示重要性一个网页的PR值越大表明这个网页越重要。
一个网页的PR值在一定程序上取决于它的入度也和链接到它的网页本身的PR值有关基于这个思想计算任意一个网页的PR值的公式如下。
其中Bu是所有链接到u网页的网页集合网页v属于集合BuL(v)是网页v的出度。下面我们就用下图的网页链接关系举例。
假定A、B、C、D网页的初始PR值都为0.25根据上面的计算公式我们有如下的计算过程。
经过多次的迭代计算后PR值逐渐稳定即可认为PR值收敛。从计算结果看出B、D的PR值较高这表明B、D的重要程度高这也符合我们对图的直观感受。
如果有向图中有一个顶点的出度为0即这个网页没有链接到其他的网页则会出现排名泄漏问题。以下图为例A顶点的出度为0。
出现这种问题的原因可以理解为A网页对整个网页没有PR值的贡献因为它的出度为0相反它还吸收其它网页对它PR值的贡献导致整个网页的PR值越来越小。
如果有向图中有一个顶点的入度为0即没有其他网页链接到这个网页则会出现排名下沉问题。以下图为例A顶点的入度为0。
因为A的入度为0则在第一次迭代的时候A的PR值就为0以后都为0。
随机浏览模型是符合用户上网行为的一种模型。用户随机打开一个网页后要么点击这个网页上的链接继续网页的浏览要么随机转到另外的一个网页重新开始新一轮的浏览。
为此随机浏览模型引入了一个阻尼系数d来表示用户点击此网页上的链接继续浏览的概率则1-d就是用户重新进行新一轮的浏览的概率。引入阻尼系数d的计算公式如下。
引入阻尼系数的效果为在原有的有向图中添加了一个全链接的浏览关系这样就完全解决了简化模型中出现的排名泄漏和排名下沉的问题。如下图所示。
以上就是Google开创的PageRank算法是不是觉得原理很简单但就是这样一个原理简单的算法使Google成为搜索领域的霸主。
课程一:《3小时快速学习计算机基础》、课程二:《精华Python小课 3天零基础入门》、课程三:《
2.1基于词频统计词位置加权的搜索引擎 利用关键词在文档中出现的频率和位置排序是搜索引擎最早期排序的主要思想,其技术发展也最为成熟,是第一阶段搜索引擎的主要排序技术,应用非常广泛,至今仍是许多搜索引擎的核心排序技术。其基本原理是:关键词在文档中词频越高,出现的位置越重要,则被认为和检索词的相关性越好。 1)词频统计 文档的词频是指查询关
学习了一段时间大概知道些SEO常识,但是具体每一项的影响有多少自己并不清楚,对自己来说是个谜,今天偶然看到2010年
,觉得对自己很有帮助,感觉清晰多了。虽然百度文库里都有,发出来,看看对大家有没有帮助。至少有所了解,虽然各项权重会发生变化,但是基本内容是万变不离其中。
`HarmonyOS` is the first full-scene distributed OS based on micro-kernel. It is an operating system
而言的重要程度。 PageRank 的设计思路如下: 初始化过程: 将原始文档的每个 Page 行末尾加上 1.0 表示的 PageRank 值初始化为 1 迭代计算过程:经过 Map 方法处理后,每行存放的数据格式为 page_name \t list_page_name...
主攻网站用户体验,主要会看网站:页面加载速度快慢、移动端有没有做优化、网站是否安装HTTPS协议 、网站广告多不多,等网站基础因素,简单讲就是谷歌搜索
这次主攻用户体验,网站用户体验跟不上,会对网站降权。 建网站就是给用户访问的的,用户感觉爽网站才是成功的,谷歌更新之后 ,预计百度也会很快跟上,对于站长们来讲还是要把网站用户体验搞一搞,只要用户体验和网站内容跟上了,网站留人不是问
本文主要研究的课题是:炉温系统的PID控制器设计研究 ,并且在MATLAB的大环境下进行模拟仿线)第一章 介绍课题的研究背景、意义以及发展现状。 (2)第二章 建立炉温系统数学模型 (3)第三
1、网站的权重性 这个主要是pr,我们测试的站中有pr6,pr4,pr3,pr2,pr0的站,我们相同的标题,不同的内容,在次日这个词在
的。 2、内容的原创性 我们有一个是pr3的站,是转了pr2站上面的内容,并给pr2的站加了链接,在
原理。这原本是一个小组的任务,我们在网上搜集了相关资料整理成了PPT,用于展示。如果不嫌弃的话可以下载来看看:
创始人拉里佩奇和谢尔盖布林于1997年构建早期的搜索系统原型时提出的链接分析
brain_xiao:跟机器的位数应该是无关的,跟你要操作的数值的类型是有关的。你可以试试将一个long类型的变量左移或者右移64看看。

