Python爬虫-什么是爬虫？-白红宇

Python爬虫-什么是爬虫？

阅读量：4947 次

发布时间：2019-06-11

本文共 907 字，大约阅读时间需要 3 分钟。

百度百科是这样定义爬虫的：

（又被称为网页，网络机器人，在社区中间，更经常的称为网页追逐者），是一种按照一定的规则，自动地抓取信息的程序或者脚本。另外一些不常使用的名字还有、自动索引、模拟程序或者。

通俗的解释：

　　打开一个网页，里面有网页内容吧，想象一下，有个工具，可以把网页上的内容获取下来，存到你想要的地方，这个工具就是我们今天的主角：爬虫。

　　打开浏览器（强烈建议谷歌浏览器），找到浏览器地址栏，然后在里敲网址https://music.163.com/，你会看到网页内容。

　　鼠标在页面上点击右键，然后点击查看网页源代码（view page source）。看到这些文字了吗？这才是网页本来的样子。

　　其实，所有的网页都是HTML+CSS+JavaScript代码，只不过浏览器将这些代码解析成了上面的网页，我们的小爬虫抓取的其实就是这些代码中的文本啦。

　　这不合理啊，难不成那些图片也是文本？

　　恭喜你，答对了。回到浏览器中有图的哪个tab页，鼠标右键，点击Inspect。会弹出一个面板，点击板左上角的箭头，点击虐狗图片，你会看到下面有红圈圈的地方，是图片的网络地址。图片可以通过该地址保存到本地哦。

　　没错，我们的小爬虫抓取的正是网页中的数据，但是前提是你要知道你想要抓取什么数据，你的目标网站是什么，才可以把想法变成现实的哦。

　　说了这么多，学习Python爬虫还是需要一定的基础知识呢？

　　注（参考）：

转载于:https://www.cnblogs.com/MakeView660/p/9577175.html

你可能感兴趣的文章