分类导航

【原】小玩node+express爬虫-1

发布时间：2017年02月14日作者：文章转自网络，版权归原作者所有，反馈可立刻删除 (该文来自笔记，点击查看原文)

百度百科的解释：

爬虫即网络爬虫，是一种自动获取网页内容的程序。是搜索引擎的重要组成部分，因此搜索引擎优化很大程度上就是针对爬虫而做出的优化。

通俗一点讲：

把别人网站的信息给弄下来，弄到自己的电脑上。然后再做一些过滤，比如筛选啊，排序啊，提取图片啊，链接什么的。获取你需要的信息。

如果数据量很大，而且你的算法又比较叼，并且可以给别人检索服务的话，那么你的爬虫就是一个小百度或者小谷歌了

了解完什么是爬虫之后，我们再来了解一下爬虫的协议了，也就是哪些东西才已去爬。

Robots协议（也称为爬虫协议、机器人协议等）的全称是“网络爬虫排除标准”（Robots Exclusion Protocol），网站通过Robots协议告诉搜索引擎哪些页面可以抓取，哪些页面不能抓取。　

robots.txt文件是一个文本文件，它是