当前位置:首页 > SEO网站 > 正文内容

网站禁止垃圾蜘蛛访问抓取教程说明

admin4年前 (2023-02-21)SEO网站410

很多国外商业蜘蛛实际对网站没有什么价值,尤其国内网站的SEO优化运营更是用不上,但是如果不屏蔽就会对网站造成很大的性能宽带消耗,引起SEO优化负面影响,所以可以根据自己的需要去处理。

nginx服务端禁止Scrapy等工具的抓取

if ($http_user_agent ~* (Scrapy|Curl|HttpClient)) {

return 403;

}

nginx服务端禁止非GET|HEAD|POST方式的抓取

if ($request_method !~ ^(GET|HEAD|POST)$) {

return 403;

}

nginx服务端禁止指定蜘蛛抓取

if ($http_user_agent ~ "MegaIndex|MegaIndex.ru|BLEXBot|Qwantify|qwantify|semrush|Semrush|serpstatbot|hubspot|python|Bytespider|Go-http-client|Java|PhantomJS|SemrushBot|Scrapy|Webdup|AcoonBot|AhrefsBot|Ezooms|EdisterBot|EC2LinkFinder|jikespider|Purebot|MJ12bot|WangIDSpider|WBSearchBot|Wotbox|xbfMozilla|Yottaa|YandexBot|Jorgee|SWEBot|spbot|TurnitinBot-Agent|mail.RU|perl|Python|Wget|Xenu|ZmEu|^$" )

{

return 444;

}

IIS服务端

ignoreCase="true" />

IIS6请在isapi重写组件中添加规则

#Block spider

RewriteCond %{HTTP_USER_AGENT} (MegaIndex|MegaIndex.ru|BLEXBot|Qwantify|qwantify|semrush|Semrush|serpstatbot|hubspot|python|Bytespider|Go-http-client|Java|PhantomJS|SemrushBot|Scrapy|Webdup|AcoonBot|AhrefsBot|Ezooms|EdisterBot|EC2LinkFinder|jikespider|Purebot|MJ12bot|WangIDSpider|WBSearchBot|Wotbox|xbfMozilla|Yottaa|YandexBot|Jorgee|SWEBot|spbot|TurnitinBot-Agent|mail.RU|perl|Python|Wget|Xenu|ZmEu|^$) [NC]

RewriteRule !(^/robots.txt$) - [F]

apache服务端

RewriteEngine On

#Block spider

RewriteCond %{HTTP_USER_AGENT} "MegaIndex|MegaIndex.ru|BLEXBot|Qwantify|qwantify|semrush|Semrush|serpstatbot|hubspot|python|Bytespider|Go-http-client|Java|PhantomJS|SemrushBot|Scrapy|Webdup|AcoonBot|AhrefsBot|Ezooms|EdisterBot|EC2LinkFinder|jikespider|Purebot|MJ12bot|WangIDSpider|WBSearchBot|Wotbox|xbfMozilla|Yottaa|YandexBot|Jorgee|SWEBot|spbot|TurnitinBot-Agent|mail.RU|perl|Python|Wget|Xenu|ZmEu|^$" [NC]

RewriteRule !(^robots\.txt$) - [F]

通过robots.txt禁止

对于遵循robots协议的蜘蛛,可以直接在robots禁止。上面常见的无用蜘蛛禁止方法如下,将下面的内容加入到网站根目录下面的robots.txt就可以了。常见的一些屏蔽恶意蜘蛛代码如下,也可以根据自己需要进行增减。

User-agent: SemrushBot

Disallow: /

User-agent: DotBot

Disallow: /

User-agent: MegaIndex.ru

Disallow: /

User-agent: MauiBot

Disallow: /

User-agent: AhrefsBot

Disallow: /

User-agent: MJ12bot

Disallow: /

User-agent: BLEXBot

Disallow: /

常见的网络恶意垃圾爬虫蜘蛛

上面说的搜索引擎爬虫能给网站带来流量,也有许多爬虫除了增加服务器负担,对网站没任何好处,应该屏蔽掉。

1、MJ12Bot

MJ12Bot 是英国著名SEO公司Majestic的网络爬虫,其抓取网页给需要做SEO的人用,不会给网站带来流量。

2、AhrefsBot

AhrefsBot 是知名SEO公司Ahrefs的网页爬虫。其同样抓取网页给SEO专业人士用,不会给网站带来流量。

3、SEMrushBot

SEMrushBot 也是SEO、营销公司的网络爬虫。

4、DotBot

DotBot 是 Moz.com 的网页爬虫,抓取数据用来支持 Moz tools 等工具。

5、MauiBot

MauiBot 不同于其他爬虫,这个爬虫连网站都没有,UA只显示一个邮箱:”MauiBot (crawler.feedback+wc@gm ail.com)“。神奇的是这个看起来是个人爬虫,竟然遵循robots协议,算得上垃圾爬虫的一股清流。

6、MegaIndex.ru

这是一个提供反向链接查询的网站的蜘蛛,因此它爬网站主要是分析链接,并没有什么作用。遵循robots协议。

7、BLEXBot

这个是webmeup下面的蜘蛛,作用是收集网站上面的链接,对我们来说并没有用处。遵循robots协议。

SEO结束语:以上来源收集汇总,请根据自己实际需要进行准确设置。

警惕垃圾蜘蛛影响网站SEO收录排名

扫描二维码推送至手机访问。

版权声明:本文由老苏SEO转载并发布,如侵权可联系删除。

本文链接:https://laosuseo.com/?id=7339

分享给朋友:

“网站禁止垃圾蜘蛛访问抓取教程说明” 的相关文章

SEO优化:META标签巧用提升排名

SEO优化:META标签巧用提升排名

META标签是网页head区的辅助性标签,它的作用是通过设置一些参数用以描述页面属性。META包括了2个重要的属性,一个是http-equlv(页面标题信息)和name(页面描述信息)。合乎W3C规范的源代码必须包含这2个基本属性。其中页面标题信息往往是固定的,不同网页变化不大,只要符合W3C规范即...

做seo优化前需要考虑哪些

做seo优化前需要考虑哪些

打开凤凰新闻,查看更多高清图片一,终端的变化毫无疑问,各大互联网公司的大量实际工作都是在移动端完成的,包括日常例会、绩效考核、统计、广告宣传等。越来越多的营销推广发生在手机端,所以当我们开始SEO之路时,我们应该了解更多手机端的搜索策略,特别是在医疗行业,比如医院网站推广。更直观的事情是掌握熊的掌纹...

如何巧用SEO优化中的标签

如何巧用SEO优化中的标签

对于SEOer,在HTML代码中使用某些标签可以使搜索引擎蜘蛛更易于阅读,而适当地放置某些优化的标签可能会产生意外的结果。下面列出了一些标签的妙用。1.标题标签,在网页html代码中,标签是最大的定义标题建议标签在整个页面上只出现一次。—您可以定义标题。权重大小按最大顺序向后减小。除了标签以外,其他...

SEO优化中description标签有什么用处,使用有何技巧?

SEO优化中description标签有什么用处,使用有何技巧?

原标题:SEO优化中description标签有什么用处,使用有何技巧?SEO优化中description标签有什么用处?网站优化过程中,TDK标签设置是一个很基础和很重要的工作,TDK标签包括title(标题)、keywords(关键词)、description(描述)这三个标签,今天我们主要来聊...

SEO未来的发展及演变

SEO未来的发展及演变

原标题:SEO未来的发展及演变查看军哥SEO学堂分享SEO,网络营销优化等互联网的经验学习关于SEO的未来,很多人很悲观。以至于Zac得经常写写些文章给国内的SEO行业打打气。Zac昨天的文章列举了一些搜索引擎的数据给大家,证明搜索引擎对网站而言,依旧非常重要。互联网的发展确实非常快,别说是SEO会...

外贸建站平台必备SEO优化秘籍

外贸建站平台必备SEO优化秘籍

通过超店Shoplus外贸建站平台建站,需要从哪些方面入手做SEO优化呢?一、外贸网站检测在做网站优化之前,首先要对外贸网站进行测试,因为外贸网站外贸网站是提高网站排名的基础,如果自己的网站有问题,以后再多做优化工作也没有用。外贸网站的检测主要包括外贸网站是否为独立域名、服务器是否为国外服务器、网站...