技能标签
专业技能
精通Hadoop生态体系(HDFS/MapReduce/YARN),擅长Spark流批一体开发(SparkSQL/SparkStreaming),精通实时数仓架构设计,熟悉Flink流处理框架,精通Hive数仓分层建模(ODS/DWD/DIM/DWD/DWS/APP),掌握Kafka消息中间件与Flume数据采集,熟悉HBase与Phoenix二级索引,精通Sqoop数据迁移工具,掌握Canal增量数据同步,熟悉MySQL与Oracle数据库优化,具备Linux系统运维与Shell/Python脚本开发能力,熟悉阿里云EMR平台与DataWorks任务调度
工作履历(脱敏处理)
专注于大数据平台架构设计与开发,主导离线数仓分层建设(ODS/DWD/DIM/DWD/DWS/APP),实现业务数据全链路处理。精通SparkSQL与SparkStreaming开发,优化数据倾斜问题,提升计算效率30%以上。设计实时数仓架构,基于Flink实现流式数据处理,支持实时指标计算。主导Kafka消息队列搭建与数据采集方案,日均处理千万级数据量。完成Hive表结构优化与查询性能提升,降低查询响应时间40%。搭建数据质量监控体系,实现任务异常自动告警,保障数据准确率。
项目经验(脱敏处理)
项目一:XX本地生活离线数仓建设
1. 构建多层数据仓库架构(ODS/DWD/DIM/DWD/DWS/APP),采用维度建模设计星型模型,支持多维度分析
2. 实现数据采集方案:通过Flume采集业务数据至Kafka,Spark任务完成数据清洗、聚合与存储
3. 开发数据处理流程:使用SparkSQL进行复杂查询优化,通过广播变量、累加器等技术解决数据倾斜问题
4. 构建数据质量监控体系:基于EMR平台实现数据量监控与异常告警,保障数据一致性
5. 优化计算性能:采用SortShuffle提升Shuffle效率,通过repartition/coalesce控制文件数量,降低存储成本
6. 实现数据服务化:为运营系统提供T+1离线报表,支撑GMV、用户活跃度等核心指标分析
项目二:XX社区埋点数据采集与分析
1. 设计日志采集方案:基于Flume+Kafka构建日志采集管道,实现启动日志、事件日志等全量埋点
2. 开发数据处理流程:使用Spark进行日志清洗、聚合与存储,支持实时数据看板展示
3. 实现数据建模:基于Hive构建维度表与事实表,支持多维分析与指标计算
4. 优化数据性能:通过UDF函数实现复杂业务逻辑,使用开窗函数处理TopN统计需求
5. 建立数据质量体系:制定数据校验规则,监控数据完整性与准确性,保障分析结果可靠性
驻场外包优势
服从性高
严格遵守甲方管理制度
技术扎实
3年项目实战经验
可长期驻场
接受异地项目外派
快速响应
24小时内可到岗
企业人才对接
专业IT人力外包服务
如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。
合作热线
18969108718
商务邮箱
ntit@163.com
微信扫码咨询
扫描二维码添加商务对接