IT人力外包人才简历库

返回列表

数据采集工程师

驻场外包人员
工作年限:1年 意向城市:杭州 浏览:4次 发布时间:近期

技能标签

XPath 正则表达式 异步编程 Scrapy框架 分布式爬虫 Selenium Python MySQL MongoDB 数据抓取 反爬虫策略 请求处理 数据解析 自动化脚本 数据库操作

专业技能

精通Python编程语言,熟练掌握Scrapy框架及Scrapy-Redis分布式爬虫技术,具备异步编程能力。熟练使用Selenium处理动态网页数据抓取,精通XPath和正则表达式进行数据解析。熟悉requests库实现HTTP请求,具备反爬虫策略设计能力(代理IP池、UserAgent随机化)。掌握MySQL和MongoDB数据库的增删改查操作,具备数据存储与结构化处理经验。熟悉网络协议及数据抓取技术,具备多平台数据采集方案设计能力。

工作履历(脱敏处理)

专注于数据采集系统开发,主导多个垂直领域数据抓取项目。设计并实现基于Scrapy-Redis的分布式爬虫架构,支持高并发数据采集任务。开发反爬虫策略模块,通过代理IP池和UserAgent随机化技术突破网站反采集机制。构建Selenium自动化脚本处理动态加载内容,解决抖音等平台视频数据抓取难题。完成多源数据清洗与存储方案设计,实现数据到MySQL和MongoDB的结构化存储。具备完整的数据采集技术栈能力,能够独立完成从需求分析到系统部署的全流程开发。

项目经验(脱敏处理)

1. 抖音数据采集系统:基于Selenium实现动态页面数据抓取,采用XPath定位元素,解决反爬虫机制下的视频标题、地址及用户信息采集难题。2. 虎扑球星数据采集:使用Scrapy框架构建分布式爬虫,通过Selenium处理动态加载内容,实现球星数据的结构化存储。3. 中国环境网数据采集:开发Selenium自动化脚本,提取文章正文、标题及发布时间,解决复杂页面结构解析问题。4. 百度搜索图片采集:基于requests实现请求处理,通过正则表达式提取图片链接,完成二进制数据存储到文件系统。5. 多平台数据采集系统:设计统一数据采集框架,整合Scrapy、Selenium及正则表达式技术,实现房天下、搜狗、B站等平台的多维度数据抓取。

驻场外包优势

服从性高

严格遵守甲方管理制度

技术扎实

1年项目实战经验

可长期驻场

接受异地项目外派

快速响应

24小时内可到岗

企业人才对接

专业IT人力外包服务

如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。

合作热线

18969108718

商务邮箱

ntit@163.com

微信扫码咨询

微信咨询二维码

扫描二维码添加商务对接

立即申请人才对接