百度是如此判断网站原创内容信息的
(2010-07-26 15:44:12)
标签:
杂谈 |
对于通过搜索引擎来营销的网站来说,原创内容,即第一次在网络上发表的文章,是SEO优化的首选。另外还存在一种伪原创,就是对原创进行的第二次或者第N次经过修改的转载发表。比如修改标题,增加摘要,转载不完整内容等等。
那么,百度、Google等搜索引擎对于原创的判断是如何进行的呢?
一般来讲由以下几个方面的因素决定:
1、快照日期。
2、蜘蛛抓取日期。
3、页面外链的数量。
4、文章修改的程度。
举例,如果《百度是如此判断网站原创内容信息的》于今日10点第一次发表在一个博客或者网站上。会有什么结果呢?
搜索引擎蜘蛛来到这个博客或者网站,发现这个页面,分析内容,放入数据库,并且被确定为首次发现,这就是原创!
在收录与判断的过程中的细节问题是:
1、必要条件。
假如这个网站没有被收录,这篇文章会认为是原创吗?
当然不是!因为它根本不可能出现在搜索数据库里!
如何让它成为原创内容?
第一个条件,网站必须被搜索引擎收录。
假如这个网站收录了,但是不经常更新呢?
很简单,如果不经常更新,发表的文章到收录的时候也会认为是原创的。
2、转载与采集。
如果文章被转载,就要看转载该文章的网站的更新周期与首次发表站的更新周期哪个更快。
比如在A站发表,B站转载,如果蜘蛛先访问了A站,发现了文章,再来到B站发现了文章,很明显的,原创权重归A站。
采集的情况与上述情况类似,即如果B采集A,但B收录比A早,B就可能变成原创!
3、访问时间。
在上述情况中,如果蜘蛛先访问了B站,一般情况下权重就也会给B站。
但是,如果B站转载的文章带有A站的原文章页面链接的话,刚收录的时候(假定两条结果一起出现),可能是B站的排名好一些,但当该文章被转载的次数多了以后,A站的链接就会推广开来,从而A站的排名会慢慢的上升。
不过,如果都有很多外部链接,并且相差数量不大,那么判断的规则应该回到原点,谁先被收录谁就是原创。
4、快照日期。
一般来说,快照日期显示时间最早的为原创。
但是文章发表后一周内,快照时间越早的地址将越有被认可为原创的可能。
如果文章已发表几个月,搜索引擎可能重新获取过快照,快照的日期就变了!
5、其它的可能。
如百度可能会有一个收录的数据库,经过过滤后,收录的内容才会到搜索结果里来。在这个期间就有一些问题,比如A站首次发表,B站转载。蜘蛛先访问A站再访问B站。而后可能先把B站的结果放出来了,而A站还在数据库里。
所以说搜索引擎没有收录并不表示搜索引擎蜘蛛没有访问过这些内容,也许在搜索引擎的库存里已经有记录了,只是查询的时间没有放出来而已,就像25号才放出来的内容,但是快照是20号的,这就是搜索引擎的库存内容,同时这也是检验原创的核心时间点。
这种情况一般出现在新站与老站之间,A站发表,B站转载,但A站在搜索引擎的信任度并不高的时候。不过只要是A站先被访问到的,原创权还是A站的。
6、伪原创。
大多数时候,伪原创也会被认为是原创。搜索引擎蜘蛛暂时还不能明确分别这些东西,因为其过于程序化的思维。如果文章的标题改过,段落改过,那么蜘蛛将很难确定这篇文章是否有过收录,也许它可以确定有部分内容是重复的,但不会因为这些而将这篇文章确认为是转载。当然,随着搜索引擎程式设计的提高,应该会有一个相似度的东西出来,比如文字内容相似度超过百分之几就会被认为是转载等。