IT人力外包人才简历库

返回列表

大数据开发工程师(离线/实时数仓)

驻场外包人员
工作年限:3年 意向城市:杭州 浏览:1次 发布时间:近期

技能标签

Hadoop Spark Flink Hive Kafka Flume HBase Sqoop Canal MySQL Linux Shell Python EMR 数仓架构 数据倾斜处理 任务调度优化

专业技能

精通Hadoop生态体系(HDFS/MapReduce/YARN),擅长Spark流批一体开发(SparkSQL/SparkStreaming),精通实时数仓架构设计,熟悉Flink流处理框架,精通Hive数仓分层建模(ODS/DWD/DIM/DWD/DWS/APP),掌握Kafka消息中间件与Flume数据采集,熟悉HBase与Phoenix二级索引,精通Sqoop数据迁移工具,掌握Canal增量数据同步,熟悉MySQL与Oracle数据库优化,具备Linux系统运维与Shell/Python脚本开发能力,熟悉阿里云EMR平台与DataWorks任务调度

工作履历(脱敏处理)

专注于大数据平台架构设计与开发,主导离线数仓分层建设(ODS/DWD/DIM/DWD/DWS/APP),实现业务数据全链路处理。精通SparkSQL与SparkStreaming开发,优化数据倾斜问题,提升计算效率30%以上。设计实时数仓架构,基于Flink实现流式数据处理,支持实时指标计算。主导Kafka消息队列搭建与数据采集方案,日均处理千万级数据量。完成Hive表结构优化与查询性能提升,降低查询响应时间40%。搭建数据质量监控体系,实现任务异常自动告警,保障数据准确率。

项目经验(脱敏处理)

项目一:XX本地生活离线数仓建设

1. 构建多层数据仓库架构(ODS/DWD/DIM/DWD/DWS/APP),采用维度建模设计星型模型,支持多维度分析

2. 实现数据采集方案:通过Flume采集业务数据至Kafka,Spark任务完成数据清洗、聚合与存储

3. 开发数据处理流程:使用SparkSQL进行复杂查询优化,通过广播变量、累加器等技术解决数据倾斜问题

4. 构建数据质量监控体系:基于EMR平台实现数据量监控与异常告警,保障数据一致性

5. 优化计算性能:采用SortShuffle提升Shuffle效率,通过repartition/coalesce控制文件数量,降低存储成本

6. 实现数据服务化:为运营系统提供T+1离线报表,支撑GMV、用户活跃度等核心指标分析

项目二:XX社区埋点数据采集与分析

1. 设计日志采集方案:基于Flume+Kafka构建日志采集管道,实现启动日志、事件日志等全量埋点

2. 开发数据处理流程:使用Spark进行日志清洗、聚合与存储,支持实时数据看板展示

3. 实现数据建模:基于Hive构建维度表与事实表,支持多维分析与指标计算

4. 优化数据性能:通过UDF函数实现复杂业务逻辑,使用开窗函数处理TopN统计需求

5. 建立数据质量体系:制定数据校验规则,监控数据完整性与准确性,保障分析结果可靠性

驻场外包优势

服从性高

严格遵守甲方管理制度

技术扎实

3年项目实战经验

可长期驻场

接受异地项目外派

快速响应

24小时内可到岗

企业人才对接

专业IT人力外包服务

如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。

合作热线

18969108718

商务邮箱

ntit@163.com

微信扫码咨询

微信咨询二维码

扫描二维码添加商务对接

立即申请人才对接