有很多朋友非常担心采集的东西会不会被搜录,这里我想该和大家谈谈搜索引擎收录采集文章的要点,因为一般的朋友采集了会修改文章的部分内容,这样我们来看看是否会增加网站的权重。
首先我们要明确两个概念:原创与伪原创
原创:简单地理解就是第一次在网站上发表的内容。
伪原创:就是对原创进行的第二次或者第N次经过修改的转载发表。比如修改标题,增加摘要,转载不完整内容等等。
那么搜索引擎对于原创的判断是如何进行的呢?一般来讲有以下几个方面的因素决定:
1、快照日期。2、蜘蛛抓取日期。3、页面外链的多少。4、文章修改的程度。
举一个例子:如果一篇标题为《怎样确定网站的原创-搜索引擎研究》的文章在今天8点第一次发表在一个博客或者网站上。纳闷会有什么结果呢?
搜索引擎蜘蛛来到这个博客或者网站,发现这个页面,分析内容,放入数据库,并且被确定为首次发现,这肯定就是原创了!
那么这个收录与判断的过程中间有几个细节方面问题:
1、必要条件
假如这个网站没有被收录,这篇文章会认为是原创吗?
当然不是!因为它根本不可能出现在搜索数据库里!
如何让它成为原创内容?
第一个条件,网站必须被搜索引擎收录。
假如这个网站收录了,但是不经常更新呢?
很简单,如果不经常更新,发表的文章到收录的时候也会认为是原创的。
2、转载与采集
如果文章被转载了呢?
如果文章被转载,那么看转载这篇文章的站更新周期与首次发表站的更新周期哪个更快。
不太明白更新周期?
比如在A站发表,B站转载,如果蜘蛛先访问了A站,发现了文章,再来到B站发现了文章,很明显的,原创权重归A站。
采集的情况是否符合这种情况?
是的,采集的情况一样。如果B采集A,但B收录比A早,B就可能变成原创喽!
3、访问时间
如果蜘蛛先访问了B站呢?
当然权重给B站,一般的情况下都会这样!
如果B站转载的文章带了A站的原文章页面链接呢?
这就很明白了,刚收录的时候,如果排名,两条结果一起出现,有可能还是B站的排名好一点。
当然,文章转载次数多了以后,A站的链接越多,对A站的文章越有好处,排名会慢慢变成A站在前面。
如果另外转载的文章带的是B站页面的链接呢?
这种情况就搞笑了,给搜索引擎开了个玩笑,但它们如果判断不好,就变成了一个链接流行度的比赛了。
不过,如果都有很多外部链接,并且相差不大,那么判断的规则应该回到原点,谁先被收录谁就是原创。
4、快照日期
网站快照日期显示时间最早的,一般就是原创了吧!
不一定,这个说法要在一个更新周期之内,比如说文章发表后一周内,快照时间越早的地址将越有被认可为原创的可能。
但如果文章都发表了几个月了,说不定搜索引擎已经重新获取过快照了,快照的日期就变了!
但是还有其它的可能吗?答案是:有,一般比如百度收录网站,他可能会有一个收录的数据库,经过过滤后,收录的内容才会到搜索结果里来。在这个期间就有一些问题了,比如A站首次发表,B站转载。蜘蛛先访问A站再访问B站。而后可能先把B站的结果放出来了,而A站还在数据库里。 |