python爬虫控制aiohttp并发数量方式_Python

前言

在使用aiohttp并发访问多个页面时效率，明显比串行requests快很多，

但是也存在一个问题，就是网站检测到短时间内请求的数量过多会导致页面请求不成成功，

页面返回429 （too many requests）。

解决上述问题

目前想到两个方法

1、控制请求的时间，用sleep延时，来消耗每一次访问的时间，减少单位时间内的访问量，这样肯定是可以，但效率太低

2、控制并发数量，控制并发数量，普遍推荐用信号量来控制使用方法也比较简单如下：

from asyncio import tasks
from aiohttp.client import clientsession
from lxml import etree
from time import sleep
import time
import asyncio
import aiohttp

async def read_page_list(page_num,sem):
    params = {
        'page':page_num,
    }
    #通过连接池控制并发数量 limit 默认为100  0 为无限制
    async with sem:
        try:
            async with aiohttp.clientsession() as session:
                async with session.get(url=url,params=params,headers=headers) as response:
                    text = await response.text()
        except exception as e:
            print('exception:',e)
        
        tree = etree.html(text)
        page_list = tree.xpath('//*[@id="thumbs"]/section[1]/ul/li')
        # break
        for li in page_list:
            pic_small_url = li.xpath('.//img/@data-src')[0]
            # print(pic_small_url,type(pic_small_url))
            # pic_small_url = str(pic_small_url)
            if 'small' in pic_small_url:
                temp_url = pic_small_url.replace('small','full')
                a = temp_url.rfind('/')
                temp_url1= temp_url[:a]
                pic_full_url = temp_url1+'/wallhaven-'+temp_url.split('/')[-1]
                pic_full_url = pic_full_url.replace('th','w')
                # print(page_num,pic_full_url)
                pic_list.append(pic_full_url)
            else:
                print(page_num,'find small error',pic_small_url)
            
        print(page_num,len(page_list),response.status)
        # await asyncio.sleep(1)
        #这里可以用硬延时来控制程序的访问速度，进而控制单位时间内并发的数量
        # sleep(0.5)

#定义信号量
sem = asyncio.semaphore(2)

start = time.time()
#建立任务列表
tasks = [loop.create_task(read_page_list(i,sem)) for i in range(1,20)]
loop.run_until_complete(asyncio.wait(tasks))
print('get page list use time:',time.time()-start)

实验结果

如下：

经试验只有当请求页面20个 sem=1时才不会出现服务器返回429.
当把请求页面数量改为10 sem=5是就不会出现服务返回429的情况

总结

以上为个人经验，希望能给大家一个参考，也希望大家多多支持代码网。

Pytorch:torch.diag()创建对角线张量方式

pytorch torch.diag()创建对角线张量torch.diag()torch.diag是pytorch中的一个函数，用于从给定的矩阵中提取对角线元素... [阅读全文]

python脚本请求数量达到上限,http请求重试问题

python请求数量达到上限,http请求重试由于在内网发送http请求同一个token会限制次数，所以很容易达到网关流量上限。业务中使用了多线程并发，一个线程... [阅读全文]

Python接口测试之如何使用requests发起请求

认识requests模块1、requests介绍requests是一个第三方库，因此首先需要安装这个库，安装三步走：安装：pip install requests在文件中引用这个模…

2024年07月04日 • 前端脚本

Python 中字符串修饰符详解

1. 原始字符串 (raw string) - r 或 r使用 r 或 r 前缀，可以告诉 python 字符串中的所有反斜杠都是普通字符，而不是转义字符。这在... [阅读全文]

使用python请求接口方式(可进行并发测试)

使用python请求接口python可以支持多个线程，所以可以利用python对写好的接口进行并发测试。请求接口代码如下：#coding=utf-8import... [阅读全文]

python holidays获取中国节日的示例

在python中，holidays库是一个流行的库，用于处理各种国家和地区的公共假期。然而，需要注意的是，截至2024年，holidays库的官方版本可能并不直... [阅读全文]


验证码：

验证码：

python爬虫控制aiohttp并发数量方式

2024年07月04日 • Python •我要评论

前言

解决上述问题

目前想到两个方法

实验结果

总结

相关文章:

Python接口测试之如何使用requests发起请求

发表评论