Dewei Zhai

/cv

我把缓慢、昂贵且割裂的数据交付,变成可靠的生产系统。

10 年跨 AWSAzureGCPAlibaba Cloud 的 500TB–1PB 数据平台经验:既独立从零搭建创业公司底座,也在上百人数据组织中演进核心平台。

我的优势是找出业务闭环、任务生命周期、技术架构和团队边界之间的不匹配,再把诊断变成一套更简单、治理边界明确、结果可以验证的交付系统。

我处理过的组织场景

从独立搭建创业公司底座,到在大型组织中演进持续运行的平台。

创业公司 · 0 → 1 · Enyquant

60 天交付覆盖一个国家五年的模型训练数据

一家新成立的能源公司,需要一个完整国家五年的电力运营与市场数据,供 SME 训练市场价格预测模型。

项目没有现成的平台团队;我从架构、代码到部署和日常运维端到端交付。

  • — 从开始建设平台到 SME 取得完整 DuckDB 数据集,不超过 60 天。
  • — 从零定义并实现 PIT 可见性语义,覆盖几乎所有数据和模型训练流程。
  • — 下游 SME 已用发布数据训练出可工作的模型;更具体的信息因保密不公开。

大型数据组织 · 在运行中演进 · VodafoneZiggo

搬迁数百 TB 数据,把数小时的反馈缩短到几分钟

上百人的 Data Tribe 在 1PB+ 核心平台持续运行时,将数百 TB 数据从 Oracle 迁往 Snowflake。

我以云管理员和数据工程师身份,用 AWS DMS Full Load + CDC 支持搬迁,并建设工作流自动化和前置校验。

  • — 我的职责集中在 DMS 任务、映射、监控、恢复、对账和生产支持;整个迁移由更大的跨团队项目共同完成。
  • — PowerCenter 转换与校验进入 GitLab CI/CD,覆盖至少 40 位开发者。
  • — 反馈从数小时或数天缩短到几分钟;保守估算每周至少减少 40 小时手工工作。

较大组织中的小型核心团队 · 主力交付 · PVH · FedEx

把 4–6 周的 Dashboard 路径缩短到 1–2 小时

在 PVH,分析师 Notebook 逻辑要经过分析和工程两条队列,才能变成受治理的生产数据集。

团队约十人且没有 Data Architect;我设计平台路径,并承担事实上的架构负责人角色。

  • — 用 YAML 契约、静态检查、实验层、数据质量和 DAG Factory 替代双队列重写。
  • — 端到端交付从 4–6 周缩短到约 1–2 小时,并支撑 60+ Dashboard;SQL 完成后的 review 和部署约需 10–20 分钟。

履历

  1. Feb 2026 — now

    Data Platform Owner & Platform ArchitectEnyquant

    Enyquant 是一家为电力市场建设预测与决策支持系统的能源智能创业公司。作为数据平台负责人,我从零完成云与数据底座的架构、实现、部署和日常运维。60 天内向下游 SME 交付一个国家五年的电力运营与市场数据;定义并实现覆盖几乎所有数据集和模型训练流程的 PIT 可见性语义;随后把日常开发和运行从 Databricks + ADF 切换到单 VM DuckDBPolarsDuckLake 架构,同等月度成本降低约 95%。

  2. Feb 2019 — Jan 2026

    OwnerDewei Consulting B.V.

    我在荷兰运营的独立咨询公司,通过它为企业建设和现代化数据平台、生产化复杂负载,并改善工程团队与业务团队之间的交付路径。工作覆盖架构、亲手实现、云基础设施、数据管道、CI/CD、治理和生产运维;客户包括 PVH、VodafoneZiggo 和 FedEx。2026 年暂停该公司的日常业务,把主要精力转向独立 AI 产品探索。

  3. Nov 2023 — Oct 2025

    Lead Data EngineerPVH Corp · 2nd engagement

    回到约十人的核心数据团队,继续演进 500+TB AWS 数据平台。团队没有专职 Data Architect,我承担事实上的架构负责人角色。用 YAML 契约、静态校验、实验层、数据质量控制和 DAG Factory 重构跨团队 Dashboard 交付路径,使代表性端到端交付周期从 4–6 周缩短到约 1–2 小时,并支撑 60+ Dashboard;SQL 完成后的 review 和部署约需 10–20 分钟。同时把获批的 PII 重新识别流程改造成事件驱动的 serverless 工作流,典型延迟从约 2 小时降至 5–10 分钟;约 90% 的降幅只指大账单中可识别的相关 AWS 资源成本,并非 AWS 总账单。参与 Azure Databricks 方案评审和迁移技术支持,但不负责整体迁移。

  4. Sep 2022 — Jan 2024

    Senior Data EngineerVodafoneZiggo

    在由 100+ 名工程师、分析师、Data Scientist 和项目经理组成的 Data Tribe 中,参与持续运行的 1PB+ 核心数据平台;职责位于既有架构治理之内。持续开发和优化 Scala/Spark ETL framework;以数据工程师和云管理员身份建设并运维 AWS DMS Full Load + CDC 任务,支持数百 TB Oracle → Snowflake 搬迁;把 PowerCenter workflow 转换和前置校验接入 GitLab CI/CD,为至少 40 位开发者把反馈从数小时或数天缩短到几分钟,保守估算每周减少至少 40 小时手工工作;并为 4–5 位 Data Scientist 建设 JupyterHub + MLflow 服务。

  5. Dec 2020 — Aug 2022

    Senior Data EngineerPVH Corp · 1st engagement

    加入时原有 HadoopAWS 搬迁已接近完成,工作重点是继续演进生产平台并形成可复用的工程模式。设计 Adobe、Salesforce 和 SAP 数据集成;开发幂等、配置驱动的 ETL;持续改善可观测性、数据质量和跨时区调度;参与 500+TB AWS 数据平台的日常演进和生产运维。

  6. Aug 2018 — Nov 2020

    Data EngineerFedEx (formerly TNT Digital International)

    在原 TNT Digital 约 200 人组织中的 10–15 人 DE/DS 团队工作,负责 AWSGCP 上的平台工程和数据交付。用 Terraform 管理基础设施,建设和运维 Spark/EMR ETL 与数据集成;在既有 GKE 集群上用 Kubernetes YAML 和 kubectl 开发、迁移和运维 Spark workload;支持 CI/CD、生产运维和 JupyterHub,并生产化 Data Scientist 的 Spark 逻辑。一个覆盖至少 175 个独立业务 case 的 Spark job,旧版运行 3 小时后 OOM 且无法完成,重构后完整负载在 5 分钟内完成。

  7. Feb 2018 — Jul 2018

    Data EngineerABN AMRO

    参与建设 DIAL 企业数据平台,把不同部门分散的 ETL workload 整合到共享环境。将数据处理从 Hive 迁移到 PySpark,并开发 PythonSparkHive 管道;把一位同事每周约三天的手工 Excel 流程替换成约三分钟完成的 Python 程序。

  8. Nov 2016 — Jan 2018

    Big Data ConsultantKPN

    bare-metal 基础设施上为企业客户交付和运维 Hortonworks HDP 集群。负责集群安装、配置和日常运行,开发 Hive/Spark ETL,并使用 PythonAnsibleJenkins 自动化基础设施与交付任务;用 Robot Framework 建设端到端系统健康验证套件,替代安装后的重复手工检查,每周为团队节省 8 小时以上。

  9. Oct 2012 — Nov 2016

    Network Quality EngineerKPN

    负责电信网络方案的技术验证与生产验收:评审高层和低层技术设计,在验收环境中协调实施与测试,在生产交接前识别技术和运维风险,并支持已验证系统受控进入生产。使用 Python 与 PostgreSQL 进行工程分析和自动化。

  10. Jun 2009 — Oct 2012

    Software Test EngineerHuawei

    负责 Huawei HLR/HSS 电信核心网数据库系统的集成、验证和客户交付。担任 KPN 荷兰核心数据库切换项目的测试与交付负责人,该系统容量为 1600 万用户线;经过约七个月密集测试,识别数百个不同严重等级的缺陷,并参与设计和执行分阶段迁移与回滚方案。最终成功迁移 1200 万用户,整个生产切换期间零事故;同时参与售前技术支持和售后客户交付。

精选案例

几项能代表我工作方式的结果;相关文章记录了背后的设计与交付决策。

技术栈

Cloud
AWS (deepest), Azure, Alibaba Cloud, GCP
Lakehouse
Databricks, Snowflake, Unity Catalog, Iceberg, DuckLake, DuckDB
ETL
Spark, Polars, dbt, Glue, Kafka, AWS DMS (CDC)
Languages
Python, SQL, TypeScript, Scala, Shell, Solidity, Cython
Orchestration
Airflow, ADF, Step Functions, Oozie
IaC
Terraform, AWS CDK, CDKTF, Ansible
CICD
GitHub Actions, GitLab CI/CD, Jenkins
Quality
PyDeequ, Great Expectations

出版论文

认证

  • AWS Certified Solutions Architect — Associate
  • Databricks Certified Associate Developer for Apache Spark
  • Databricks Certified Data Engineer Associate
  • — Certified Associate in Python Programming

教育背景

通信与信息系统硕士 — 西安电子科技大学,中国(2025 软科世界一流学科排名:通信工程全球第 4)。IDW 学历评估: 等同于荷兰 MSc Computing Science。