搜索引擎如何判断原创内容与非原创内容 -电脑资料

电脑资料 时间:2019-01-01 我要投稿
【www.unjs.com - 电脑资料】

    在SEO中,提倡最多的就是原创内容,

搜索引擎如何判断原创内容与非原创内容

。原创内容对搜索引擎的重要性自然不言而喻,但搜索引擎是否真的能辨别出所谓的原创内容呢?搜索引擎如...

    在SEO中,提倡最多的就是原创内容。原创内容对搜索引擎的重要性自然不言而喻,但搜索引擎是否真的能辨别出所谓的原创内容呢?搜索引擎如何判断你的就是原创内容呢?

    在google的黑板报中一再强调可以辨别原创内容,百度也有类似的声明,但搜索时却发现原创内容的网站并没有排在搜索引擎的前面,好多站的排名依旧比真正的原创高的多!这种情况已经不是一天两天了,为什么搜索引擎会出现这样情况呢?搜索引擎如何判断你的就是原创内容?:

    首先我们明确两个概念:原创与伪原创

    原创:简单地理解就是第一次在网络上发表的内容。

    伪原创:就是对原创进行的第二次或者第N次经过修改的转载发表。比如修改标题,增加摘要,转载不完整内容等等。

    搜索引擎对于原创的判断是如何进行的呢?

    一般来讲有以下几个方面的因素决定:

    1、快照日期。

    2、蜘蛛抓取日期。

    3、页面外链的多少。

    4、文章修改的程度。

    举例:如果一篇标题为《搜索引擎如何确定你的就是原创内容》的文章在今天10点第一次发表在一个博客或者网站上。会有什么结果呢?

    搜索引擎蜘蛛来到这个博客或者网站,发现这个页面,分析内容,放入数据库,并且被确定为首次发现,这肯定就是原创了!

    那么这个收录与判断的过程中间有几个细节方面问题:

    1、必要条件

    ——假如这个网站没有被收录,这篇文章会认为是原创吗?

    ——当然不是!因为它根本不可能出现在搜索数据库里!

    ——如何让它成为原创内容?

    ——第一个条件,网站必须有被搜索引擎收录。

    ——假如这个网站收录了,但是不经常更新呢?

    ——很简单,如果不经常更新,发表的文章到收录的时候也会认为是原创的。

    3、转载与采集

    ——如果文章被转载了呢?

    ——如果文章被转载,那么看转载这篇文章的站更新周期与首次发表站的更新周期哪个更快。

    ——不太明白更新周期。

    ——比如在A站发表,B站转载,如果蜘蛛先访问了A站,发现了文章,再来到B站发现了文章,很明显的,原创权重归A站。

    ——采集的情况是否符合这种情况?

    ——是的,采集的情况一样。如果B采集A,但B收录比A早,B就可能变成原创喽!

    4、访问时间

    ——如果蜘蛛先访问了B站呢?

    ——当然权重给B站,一般的情况下都会这样!

    ——如果B站转载的文章带了A站的原文章页面链接呢?

    ——这就很明白了,刚收录的时候,如果排名,两条结果一起出现,有可能还是B站的排名好一点。

    当然,文章转载次数多了以后,A站的链接越多,对A站的文章越有好处,排名会慢慢变成A站在前面。

    ——如果另外转载的文章带的是B站页面的链接呢?

    ——这种情况就搞笑了,给搜索引擎开了个玩笑,但它们如果判断不好,就变成了一个链接流行度的比赛了。

    不过,如果都有很多外部链接,并且相差不大,那么判断的规则应该回到原点,谁先被收录谁就是原创。

    5、快照日期

    ——快照日期显示时间最早的,一般就是原创了吧!

    ——不一定,这个说法要在一个更新周期之内,比如说文章发表后一周内,快照时间越早的地址将越有被认可为原创的可能。

    但如果文章都发表了几个月了,说不定搜索引擎已经重新获取过快照了,快照的日期就变了!

    ——还有其它的可能吗?

    ——有,一般比如百度收录,他可能会有一个收录的数据库,经过过滤后,收录的内容才会到搜索结果里来。在这个期间就有一些问题了,比如A站首次发表,B站转载。蜘蛛先访问A站再访问B站。而后可能先把B站的结果放出来了,而A站还在数据库里。

    所以说搜索引擎没有收录并不表示搜索引擎蜘蛛没有访问过这些内容,也许在搜索引擎的库存里已经有记录了,只是你查的时间没有放出来而已,就像25号才放出来的内容,但是快照是20号的,这就是搜索引擎的库存内容,同时这也是检验原创的核心时间点,

电脑资料

搜索引擎如何判断原创内容与非原创内容》(https://www.unjs.com)。

    这种情况一般出现在新站与老站之间,A站发表,B站转载,但A站在搜索引擎的信任度并不高的时候。不过只要是A站先被访问到的,原创权还是A站的,这是最难分出来的情况,因为我们不知道蜘蛛先访问哪个站,除非你知道两个站的网站空间日志内容,能看到搜索引擎对两个页面的访问时间。

    6、伪原创

    ——伪原创也会被认为是原创?

    ——大多时候是这样的,搜索引擎蜘蛛智力相当于三岁小孩子一样,不能明确分别这些东西,因为它的思维太程式化了。如果你的标题改过,文章的段落改过,那么蜘蛛将很难确定这篇文章是否有过收录,也许它可以确定有部分内容是重复的,但它也不能因为这些而将这篇文章确认为是转载!当然,随着搜索引擎程式设计的提高,应该会有一个相似度的东西出来,比如文字内容相似度超过百分之几就会被认为是转载。

    这样分析下来,相信大家应该了解了吧。只是核桃自己的看法,希望大家吸收自己想要的东西,不认同的了也来提下自己的意见!

    另外提几个建议:

    1、如果你的站是新站,权重不高,如何让蜘蛛首页找到你的页面并放入数据库?其实很简单:用网摘、百度收藏这些工具让蜘蛛更快的找到你的页面!

    2、大家都有过建议,就是加上自己的版权及内容页面的地址,别人采集的时候你就爽了,收录虽然不会快,但最后链接多了,你依然是原创内容。

    3、发表文章等到自己收录以后再去其它的站点进行发表,同时加上自己的原文地址,这种办法很有保障!大站被采的机率很大!

    这也就是为什么门户网站为了内容的大量更新而雇佣了不少“网站编辑”,“网站编辑”通过人肉筛选的方法从个人博客上挑选出优秀的文章,并将这些文章复制到门户网站,复制内容的同时通常会删除原始文章的作者和文章中的链接地址,同时小幅修改文章的标题,经过这一番“处理”,Google和BAIDU通常很难判断出到底哪个文章是原创了。

    搜索引擎如何判断文章是否原创 ?前几天在一个朋友的博客上看到了这骗文章,感觉说的确实不错,文章中提到了几个因素:网页本身的PR、域名注册时间、网站权威度、网页被收录时间、整体网站内容质量等.

    搜索引擎判断文章是否原创的标准,其实就是一点:就是一个排名的问题,就算你是原创,就算你等搜索引擎收录自己的原创后再给别人,别人经过整理,甚至不整理,都会排在你的前面。一个站点不具有排名优势,怎么原创都是无济于事的。

    网页本身的PR 这里的意思很明显,并不是说整个站点的PR。虽然pr被很多seo高手嗤之以鼻,但pr对于排名是一个很高的权重,或者说在影响页面排名诸多要素中,pr是个很重要的要素。

    域名注册时间 一个老域名比一个新域名排名靠前,这也是搜索引擎模仿人性思维的一个方式。就好象我们问路,比较相信年纪大的人一样。这也就是为什么很多人在做站点的时候,喜欢买一个老域名的原因。

    网站权威度 一个链接导入导出状况良好的网站,自然比一个孤立的网站要有权威,这对于页面也是相同的。这就好比你相信众人推崇的人说的话,而不相信陌生人或者名誉坏的人说的话。

    网页收录时间 和人一样,搜索引擎同样也愿意相信,第一个发布的,第一个说的,原创的可能性比较高,也就是说这个页面上的内容可能是他自己的东西。

    整体网站质量 这一点其实也属于网站权威度里面的内容。一个网站如果都是围绕一个中心去组织内容,那么搜索引擎相信你是这方面的权威。例如你组织了一个专题,一个栏目甚至一个二级域名,都在说一个事情,都是对某个关键词拓展,比如原创文章、原创文章收录、原创文章排名、原创文章判断标准、判断文章是否原创、搜索引擎如何判断文章是否原创等等。

    其实还有一点,随着搜索引擎模拟人性思维的地方越来越多,我们有理由相信,网站乃至页面结构架构的合理化组织,使内容更为合理化、人性化,让来访者更快的、更准确的获取信息,那么搜索引擎越有可能认为这是原创。

    这些我非常赞同,也就是前一段时间,我做的一个虚拟主机评测网的站点,虽然是新站,但是确实有好多都是自己的原创,朋友一直劝说去其他站发一下自己的文章,这样可以达到宣传和外联的作用,事实证明确实有效,不过同事出现了一个问题,我自己先在我的虚拟主机评测网的站点原创的文章没有被收录,反而发表在南北互联上的文章被第一时间收录了,而且点击量还不小,就是那篇关于技术人员的出路的文章。

    而且要是照上面的描述说的话,那我的原创文章就成别人的了,而且也不能说是伪原创,现在就是有这样一种感觉。所以,我感觉搜索引擎在判断文章是否原创的时候还是会取大优先的,毕竟老牌的站,排名和权重都高的情况下,他们的东西就是原创的,而且是第一时间被用户认可的,你的站同时就成了“盗版”。

最新文章