IT人力外包人才简历库

返回列表

Python爬虫开发工程师

驻场外包人员
工作年限:1年 意向城市:杭州 浏览:4次 发布时间:近期

技能标签

Python Scrapy Selenium XPath 反爬虫 数据抓取 分布式爬虫 网络协议 OCR识别 动态网页解析 数据解析 网络抓包 中间件开发 分布式架构 自动化测试

专业技能

精通HTTP/HTTPS协议及TCP/IP网络协议,掌握反爬虫策略与应对方案。熟练运用Python语言实现数据采集,精通lxml、re、json等数据解析模块。熟练使用XPath与CSS Selector进行DOM解析,掌握Selenium动态网页数据抓取技术。熟悉Scrapy框架开发,具备中间件定制能力,了解Scrapy-Redis分布式爬虫架构。熟悉网络抓包工具Fiddler,具备动态页面数据提取能力。掌握Tesseract OCR文字识别技术,可处理验证码识别场景。

工作履历(脱敏处理)

专注于数据采集系统开发,主导多个数据抓取项目实施。设计并实现反爬虫策略,成功突破目标网站的验证码识别机制。基于Scrapy框架构建分布式爬虫系统,通过中间件定制实现数据清洗与存储。开发动态网页数据抓取模块,采用Selenium结合Fiddler实现动态内容提取。完成多个第三方API对接,包括翻译服务接口集成与音乐网站数据采集。具备GUI工具开发能力,可快速构建数据可视化界面。

项目经验(脱敏处理)

1. 翻译接口对接项目:实现有道翻译与百度翻译API集成,设计反爬虫策略突破验证码识别,采用Selenium模拟浏览器操作完成动态内容抓取,日均处理数据量达50万条。

2. 音乐网站数据采集项目:基于Scrapy框架构建分布式爬虫系统,通过XPath与CSS Selector实现结构化数据提取,采用Scrapy-Redis实现任务分发与结果聚合,日均采集数据量超200万条。

3. 验证码识别系统开发:整合Tesseract OCR技术,构建验证码识别模块,成功处理多种复杂验证码类型,提升数据采集成功率至98%以上。

4. 动态网页解析工具开发:基于Fiddler抓包分析,实现动态页面数据提取,开发定制化解析脚本,解决AJAX请求数据获取难题。

驻场外包优势

服从性高

严格遵守甲方管理制度

技术扎实

1年项目实战经验

可长期驻场

接受异地项目外派

快速响应

24小时内可到岗

企业人才对接

专业IT人力外包服务

如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。

合作热线

18969108718

商务邮箱

ntit@163.com

微信扫码咨询

微信咨询二维码

扫描二维码添加商务对接

立即申请人才对接