IT人力外包人才简历库

返回列表

Python爬虫开发工程师

驻场外包人员
工作年限:1年 意向城市:杭州 浏览:7次 发布时间:近期

技能标签

Python开发 网络请求 数据解析 爬虫框架 数据库操作 分布式爬虫 自动化测试 正则表达式 Web Scraping 软件打包 IP代理 Cookie管理 Selenium MongoDB Redis AJAX处理 反爬策略

专业技能

精通Python编程语言,掌握Requests/Urllib网络请求库实现高效网络爬取;熟练使用BeautifulSoup4、PyQuery、Lxml进行HTML/XML数据解析;具备Selenium自动化浏览器操作能力,可实现复杂网页的动态内容抓取;熟悉MongoDB/Redis数据库操作,掌握PyMongo/redis-py进行数据存储与缓存管理;精通正则表达式(re)数据提取技术;具备IP代理池、Cookie池构建能力,支持分布式爬虫部署;熟悉PyInstaller软件打包技术,实现爬虫工具一键化部署。

工作履历(脱敏处理)

专注于Python爬虫系统开发与维护,主导构建多线程爬虫框架,实现日均百万级数据采集。设计IP代理池与Cookie管理模块,提升爬虫稳定性与反反爬能力。开发数据解析引擎,支持HTML/XML/JSON多格式数据提取,构建可视化数据监控系统。搭建分布式爬虫架构,实现多节点任务调度与负载均衡。开发自动化测试工具,覆盖网络请求、数据解析、数据库写入等核心模块。优化爬虫性能,使数据采集效率提升300%。

项目经验(脱敏处理)

1. 今日头条内容采集系统:基于Requests库实现高效网络请求,结合PyQuery解析HTML结构,完成文字、图片、视频内容抓取,日均采集数据量达50万条。2. B站大会员视频下载系统:通过Ajax请求获取视频资源链接,利用Selenium模拟浏览器操作绕过反爬机制,实现视频资源批量下载。3. 网易云音乐音频采集项目:开发动态URL构造算法,解析JSON响应数据,采用Redis缓存URL地址,实现音频资源分批次下载。4. GitHub用户数据采集系统:构建Cookie池管理模块,模拟多账号登录操作,完成用户信息、代码仓库等数据采集。5. 知乎/贴吧内容抓取平台:基于Selenium实现复杂网页结构解析,开发动态内容加载处理机制,完成用户评论、帖子等数据采集。6. 微博内容采集系统:设计URL构造算法,通过urllib.parse解析HTML链接,实现微博动态内容批量抓取。7. 多源数据聚合平台:开发统一数据解析引擎,支持HTML/XML/JSON多格式数据提取,构建MongoDB数据存储方案,实现数据可视化展示。

驻场外包优势

服从性高

严格遵守甲方管理制度

技术扎实

1年项目实战经验

可长期驻场

接受异地项目外派

快速响应

24小时内可到岗

企业人才对接

专业IT人力外包服务

如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。

合作热线

18969108718

商务邮箱

ntit@163.com

微信扫码咨询

微信咨询二维码

扫描二维码添加商务对接

立即申请人才对接