Python技巧：如何提高爬虫速度？

知行编程网 2022-08-06 06:00 知行编程网 | 隐藏边栏 | 抢沙发 | 15 0

文章评分 0 次，平均分 0.0 ：

文 | 闲欢

来源：Python 技术「ID: pythonall」

今天在浏览知乎时，发现一个有趣的问题：

如何优化 Python 爬虫的速度？

他的问题描述是：

目前在写一个 Python 爬虫，单线程 urllib 感觉过于慢了，达不到数据量的要求（十万级页面）。求问有哪些可以提高爬取效率的方法？

这个问题还蛮多人关注的，但是回答的人却不多。

我今天就来尝试着回答一下这个问题。

程序提速这个问题其实解决方案就摆在那里，要么通过并发来提高单位时间内处理的工作量，要么从程序本身去找提效点，比如爬取的数据用gzip传输、提高处理数据的速度等。

我会分别从几种常见的并发方法去做同一件事情，从而比较处理效率。

我们先来一个简单的爬虫，看看单线程处理会花费多少时间？

我们可以看到使用这种方式实现，比单线程版本快90倍，比多线程还快。

通过上面的程序对比，我们可以看到，对于多任务爬虫来说，多线程、多进程、协程这几种方式处理效率的排序为：aiohttp > 多线程 > 多进程。因此，对于简单的爬虫任务，如果想要提高效率，可以考虑使用协程。但是同时也要注意，这里只是简单的示例，实际运用中，我们一般会用线程池、进程池、协程池去操作。

这就是问题的答案了吗？

对于一个严谨的程序员来说，当然不是，实际上还有一些优化的库，例如grequests，可以从请求上解决并发问题。实际的处理过程中，肯定还有其他的优化点，这里只是从最常见的几种并发方式去比较而已，应付简单爬虫还是可以的

本文为原创文章，版权归知行编程网所有，欢迎分享本文，转载请保留出处！

知行编程网关注：1 粉丝：1

这个人很懒，什么都没写