搜索引擎怎样判断文章或网页的原始出处?

复制内容网页有的时候会影响网页排名。

比如说原本是你写的文章,本来应该排名很好,但是其他人抄袭或转载你的文章,而且搜索引擎不幸的判断那篇被抄袭或转载的网页是原始出处的话,你应有的排名就会被那个网页夺走。

那么搜索引擎怎样才能从多个网页中挑出哪一个是原始出处呢?可能有以下几个考虑:

1)网页PR值。网页PR值越高,被认为是原始版本的可能性就越大。

2)网页第一次被收录的时间。网页被搜索引擎收录的时候越早,相比后发现的相同内容的网页来说,被当作原始出处的可能性就越大。

3)域名注册时间。越老的域名上面的网页被当成原始出处的可能性也越大。

4)网站的权威度。这就有点说不清了,可能包含前面3个因素,还有很多其他因素。

但到目前为止,无论以哪一个因素为主,或怎样组合这些因素,都不可能完全正确从多个网页中挑出原始出处。

比如说我这个博客就很新,域名也很新,文章被收录的时间有的时候也不一定是最早的,就权威地位和被信任度来说,也肯定比不上很多中文网站。但我的博客新,我的域名新,并不意味着我的内容就不是原始出处,实际上我的所有博客都是原创。

我最近也发现了很多网站都转载,有的时候是抄袭我的博客内容,很多网站的规模,历史,PR值都比我的网站要高的多。

在检测文章原始出处方面,Google做的比较好,基本上能够正确判断,百度做的就比较差。从我的文章在不同的地方出现的情况看,百度似乎认为域名比较老的就是原创。

这个问题不是网站管理员自己可以解决的,只有依靠搜索引擎算法的改进。

作者: [email protected]每天一贴
版权属于: 中新虚拟主机
版权所有。转载时必须以链接形式注明作者和原始出处及本声明。

12 条评论 “搜索引擎怎样判断文章或网页的原始出处?

  1. 很多事情没有一个准头,我去年整理过一篇关于上海工业品志方面的资料,结果轴承网一转,结果我变成复制网页了…但是有一点我相信,与其关注head,不如关注body…

  2. 谢谢robin的补充。

    这也是我一直觉得大量内容是很重要的原因之一,总不会我所有文章都被错误当成复制网页吧…

  3. 经常需要查找文章的原始版本。我也一直希望搜索引擎能实现这个功能。

    现在想起来,最可靠的判断方式还是时间吧。谁最早发布的,谁就是原创。

  4. 问题是真实写作或发布时间是无法判断的。只能是被搜索引擎第一次收录的时间。但原创者的网站可能因为PR低等原因被爬行的频率不高,原创网页很可能没有抄袭或转载的网页收录的早。

  5. 为了避免被恶意采集,可以在网站地图sitemap.xml的里面为每篇文章添加时间,然后将sitemap.html添加上这篇文章的链接,这样搜索引擎在没有到达网页之前也会知道你的这篇文章是什么时候发布的

  6. 第二条:网页第一次被收录的时间。

    是指这个网站第一次被搜索引擎收录的时间呢?还是原创内容所在的这个页面被搜索引擎收录的时间。

    谢谢Zac老师。

  7. 第二条:网页第一次被收录的时间。

    是指这个网站第一次被搜索引擎收录的时间呢?还是原创内容所在的这个页面被搜索引擎收录的时间。

    谢谢Zac老师。

留个言呗:

您的邮箱不会被显示在页面上。标有*的是必填项。