python爬虫分布式获取数据的实例方法

脚本专栏 2026/4/18 佚名

3 2 1

明霞山资源网 Design By www.htccd.com

在我们进行卫生大扫除的时候，因为工作任务较多，所以我们会进行分工，每个人负责不同的打扫项目。同样分工合作的理念，在python分布式爬虫中也得到了应用。我们需要给不同的爬虫分配指令，让它们去分头行动获取同一个网站的数据。那么这些爬虫是怎么分工搜集数据的呢？感兴趣的小伙伴，我们可以通过下面的示例进行解惑。

假设我有三台爬虫服务器A、B和C。我想让我所有的账号登录任务分散到三台服务器、让用户抓取在A和B上执行，让粉丝和关注抓取在C上执行，那么启动A、B、C三个服务器的celery worker的命令就分别是

celery -A tasks.workers -Q login_queue,user_crawler worker -l info -c 1 # A服务器和B服务器启动worker的命令，它们只会执行登录和用户信息抓取任务。

celery -A tasks.workers -Q login_queue,fans_followers worker -l info -c 1 # C服务器启动worker的命令，它只会执行登录、粉丝和关注抓取任务。

然后我们通过命令行或者代码（如下）就能发送所有任务给各个节点执行了

# coding:utf-8
from tasks.workers import app
from page_get import user as user_get
from db.seed_ids import get_seed_ids, get_seed_by_id, insert_seeds, set_seed_other_crawled
@app.task(ignore_result=True)
def crawl_follower_fans(uid):
  seed = get_seed_by_id(uid)
  if seed.other_crawled == 0:
    rs = user_get.get_fans_or_followers_ids(uid, 1

    rs.extend(user_get.get_fans_or_followers_ids(uid, 2))
    datas = set(rs)
    # 重复数据跳过插入
    if datas:
      insert_seeds(datas)
    set_seed_other_crawled(uid)
@app.task(ignore_result=True)
def crawl_person_infos(uid):
  ""
  根据用户i来爬取用户相关资料和用户的关注数和粉丝数（由于微博服务端限制，默认爬取前五页，企业号的关注和粉丝也不能查看）
  :param uid: 用户id
  :return:
  """
  if not uid:
    return
  # 由于与别的任务共享数据表，所以需要先判断数据库是否有该用户信息，再进行抓取
  user = user_get.get_profile(uid)
  # 不抓取企业号
  if user.verify_type == 2:
    set_seed_other_crawled(uid)
    return
  app.send_task('tasks.user.crawl_follower_fans', args=(uid,), queue='fans_followers',
         routing_key='for_fans_followers')
@app.task(ignore_result=True)
def excute_user_task():
  seeds = get_seed_ids()
  if seeds:
    for seed in seeds:
      # 在send_task的时候指定任务队列
      app.send_task('tasks.user.crawl_person_infos', args=(seed.uid,), queue='user_crawler',
             routing_key='for_user_info')

分布式爬虫架构图

python爬虫,分布式

标签：

python爬虫,分布式

明霞山资源网 Design By www.htccd.com

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站文章均来自网站采集或用户投稿，网站不提供任何软件下载或自行开发的软件！如有用户或公司发现本站内容信息存在侵权行为，请邮件告知！ 858582#qq.com

明霞山资源网 Design By www.htccd.com

评论“python爬虫分布式获取数据的实例方法”

暂无评论...

www.htccd.com 明霞山资源网

139,976互联网资源

144,792高清电影

21,817无损音乐

631,128技术资源

最新文章

群星《奔赴！万人现场第2期》[FLAC/分轨][5

2026/4/18

群星《奇妙浪一夏 (上海迪士尼度假区音乐)》

2026/4/18

群星《奇妙浪一夏 (上海迪士尼度假区音乐)》

2026/4/18

【古典音乐】詹姆斯·高威《季节》1993[WAV+

2026/4/18

贝拉芳蒂《卡里普索之王》SACD[WAV+CUE]

2026/4/18

一句话新闻

苹果官宣WWDC 2024！预计会有大批AI功能 - 2026/4/18

3月27日消息，苹果宣布2024年全球开发者大会（WWDC）将于6月10日至6月14日举行，巧合的是，这次大会与端午假期重合。

苹果官方表示：

在线参加 Apple 每年规模最大的开发者盛会。亲眼见证 Apple 最新平台、技术和工具的发布。了解如何创建和改进你的 App 和游戏。与 Apple 设计师和工程师互动交流，与全球开发者社区建立联系。以上活动均免费在线举行。

探索各种新的工具、框架和功能，助力你打造出理想的 App 和游戏。通过视频讲座学习新技能，与 Apple 专家进行一对一会面，以推进你的项目，完善你的构思。

Swift Student Challenge 旨在支持和鼓舞下一代开发者、创作者和企业家。太平洋时间 3 月 28 日，我们将公布今年的获奖者名单。获奖者将有资格参加在 Apple Park 举办的特别活动。我们还会选出 50 名杰出获胜者，他们将受邀前往库比提诺，获得为期三天的非凡体验，包括参加 Apple Park 的特别活动。

python爬虫分布式获取数据的实例方法

python爬虫,分布式

Python基于execjs运行js过程解析

celery在python爬虫中定时操作实例讲解

评论“python爬虫分布式获取数据的实例方法”

RTX 5090要首发性能要翻倍！三星展示GDDR7显存

友情链接

python爬虫分布式获取数据的实例方法

python爬虫,分布式

Python基于execjs运行js过程解析

celery在python爬虫中定时操作实例讲解

评论“python爬虫分布式获取数据的实例方法”

RTX 5090要首发 性能要翻倍！三星展示GDDR7显存

友情链接

RTX 5090要首发性能要翻倍！三星展示GDDR7显存