09-08
21

爬虫如何辨别文章的原创、伪原创与转载

在谈论之前,我们首先应该明确三个基本概念:原创与伪原创以及转载

先说转载:顾名思义就是原原本本的从网络媒体上照抄照搬过来的文章。

原创:很好理解,就是第一次在网络上发表的文章内容。

  伪原创:就是对网络上收集到的一些原创内容进行N次修改,转而进行发表的文章。比如修改文章的标题,增加文章摘要,转载不完整的文章内容等等。

  搜索引擎对于原创的识别判断是如何进行的呢?

  一般来讲,有以下几个方面的因素决定:

  1、快照生成的日期。

  2、蜘蛛抓取的日期。

  3、网站页面外链的多少。

  4、文章内容雷同相似的程度。

  举例:如果一篇标题为《蜘蛛如何辨别原创内容.》的文章在今天早上8:00首次发表在一个BBS、BLOG或者网站上。会有什么样的结果呢?

  蜘蛛来到这个BBS、BLOG或者网站,发现了这个页面,分析页面上《蜘蛛如何辨别原创内容.》的的文章内容,放入搜索引擎数据库,并经识别判断被认定为首次发现,那么《蜘蛛如何辨别原创内容.》的这篇文章肯定就是原创了!

  当然,在蜘蛛爬过来识别文章时,收录与判断的过程中间有几个细节问题,需要大家参考:

  1、认定为原创文章的必要条件

  假如这个网站没有被收录,这篇文章会认为是原创吗? 当然不会!因为它根本不可能出现在搜索引擎的数据库里!

  那么,如何让它被认定成为原创内容呢?

第一个条件,网站必须有被搜索引擎收录。假如这个网站被收录了,但是不经常更新呢? 很简单,如果不经常更新,发表的文章到被蜘蛛搜索到并收录的时候也会认为是原创的。

  2、转载与采集后原创的认定

  如果这篇文章被转载了呢? 如果文章被转载,那么看转载这篇文章的站更新周期与首次发表这篇文章的站的更新周期哪个更快。

  不太明白更新周期?举个例子说明:比如在A站发表,B站转载,如果蜘蛛先访问了A站,发现了文章,再来到B站发现了文章,很明显的,原创权重归A站。

  那么采集的情况是否符合这种情况? 当然,采集的情况一样。如果B采集A,但B收录比A早,B就可能变成原创!

  3、蜘蛛的访问时间

  如果蜘蛛先访问了B站呢? 当然权重给B站,一般的情况下都会这样!

  如果B站转载的文章带了A站的原文章页面链接呢? 这就很明白了,刚收录的时候,如果排名,两条结果一起出现,有可能还是B站的排名好一点。 当然,文章转载次数多了以后,A站的链接越多,对A站的文章越有好处,排名会慢慢变成A站在前面。

  如果另外转载的文章带的是B站页面的链接呢? 这种情况就搞笑了,给搜索引擎开了个玩笑,但它们如果判断不好,就变成了一个链接流行度的比赛了。不过,如果都有很多外部链接,并且相差不大,那么判断的规则应该回到原点,谁先被收录谁就是原创。

  4、网页快照生成的日期

  搜索结果中网页快照日期显示时间最早的,一般就是原创了吧! 不一定,这个说法要在一个更新周期之内,比如说文章发表后一周内,快照时间越早的地址将越有被认可为原创的可能。 但如果文章都发表了几个月了,说不定搜索引擎已经重新获取过快照了,快照的日期就变了!

  还有其它的可能吗? 有,比如百度收录,他可能会有一个收录的数据库,经过过滤后,收录的内容才会到搜索结果里来。在这个期间就有一些问题了,比如A站首次发表,B站转载。蜘蛛先访问A站再访问B站。而后可能先把B站的结果放出来了,而A站还在数据库里。

  所以说搜索引擎没有收录并不表示搜索引擎蜘蛛没有访问过这些内容,也许在搜索引擎的库存里已经有记录了,只是你查的时间没有放出来而已,就像25号才放出来的内容,但是快照是20号的,这就是搜索引擎的库存内容,同时这也是检验原创的核心时间点。

  这种情况一般出现在新站与老站之间,A站发表,B站转载,但A站在搜索引擎的信任度并不高的时候。不过只要是A站先被访问到的,原创权还是A站的,这是最难分出来的情况,因为我们不知道蜘蛛先访问哪个站,除非你知道两个站的网站空间日志内容,能看到搜索引擎对两个页面的访问时间。

  5、文章的伪原创

  伪原创也会被认为是原创?大多数时候是这样的,搜索引擎蜘蛛智力,你不要给予很高的期望,它就相当于三岁的小孩子,不能明确辨别这些内容是否一样,因为它的思维太程式化了。如果你把文章的标题修改过,把文章的段落、结构、顺序等修改过,甚至是两篇或多篇内容差不多的文章混合在一起加工过,那么搜索引擎的蜘蛛就很难判断这篇文章是否被收录,或许它可以判断出有部分内容是相似或重复的,但是它不能因为这些细微的相似,而将这篇经过“深加工”的伪原创文章判断为是转载!当然,搜索引擎程式设计中有一个相似度的东西,比如文字内容相似度超过百分之几就会被认为是转载。

顺便提几个建议:

  1、如果你的网站是一个新站,当前网站的权重不高,如何让搜索引擎的蜘蛛首页找到你的网站页面并放入搜索引擎的数据库?其实有一个简单有效、省时省力的方法:充分利用网摘、百度收藏等工具,让蜘蛛更快的爬到你的页面上来!

  2、就是使用代码把网站加上自己的版权及内容页面的地址,别人采集的时候自动添加你的网站链接或者文章来源的具体链接地址,这样做收录虽然不会快,但最后链接多了,你依然是原创内容。

  3、在自己的网站上发表“原创”文章,等到自己收录以后,再去其它的站点进行发表,同时加上自己的原文地址,这种办法很有很有效果,一些规模较大、影响较广的网站被采的机率很大,发到这些大的网站上,带来的流量非常可观!


文章来自: 本站原创
引用通告: 查看所有引用 | 我要引用此文章
Tags: 爬虫
相关日志:
评论: 0 | 引用: 0 | 查看次数: 289
发表评论
昵 称:
密 码: 游客发言不需要密码.
内 容:
验证码: 验证码
选 项:
虽然发表评论不用注册,但是为了保护您的发言权,建议您注册帐号.
字数限制 1000 字 | UBB代码 开启 | [img]标签 关闭