创业公司 · 0 → 1 · Enyquant
60 天交付覆盖一个国家五年的模型训练数据
一家新成立的能源公司,需要一个完整国家五年的电力运营与市场数据,供 SME 训练市场价格预测模型。
项目没有现成的平台团队;我从架构、代码到部署和日常运维端到端交付。
- — 从开始建设平台到 SME 取得完整 DuckDB 数据集,不超过 60 天。
- — 从零定义并实现 PIT 可见性语义,覆盖几乎所有数据和模型训练流程。
- — 下游 SME 已用发布数据训练出可工作的模型;更具体的信息因保密不公开。
/cv
10 年跨 AWS、Azure、GCP 和 Alibaba Cloud 的 500TB–1PB 数据平台经验:既独立从零搭建创业公司底座,也在上百人数据组织中演进核心平台。
我的优势是找出业务闭环、任务生命周期、技术架构和团队边界之间的不匹配,再把诊断变成一套更简单、治理边界明确、结果可以验证的交付系统。
从独立搭建创业公司底座,到在大型组织中演进持续运行的平台。
创业公司 · 0 → 1 · Enyquant
一家新成立的能源公司,需要一个完整国家五年的电力运营与市场数据,供 SME 训练市场价格预测模型。
项目没有现成的平台团队;我从架构、代码到部署和日常运维端到端交付。
大型数据组织 · 在运行中演进 · VodafoneZiggo
上百人的 Data Tribe 在 1PB+ 核心平台持续运行时,将数百 TB 数据从 Oracle 迁往 Snowflake。
我以云管理员和数据工程师身份,用 AWS DMS Full Load + CDC 支持搬迁,并建设工作流自动化和前置校验。
较大组织中的小型核心团队 · 主力交付 · PVH · FedEx
在 PVH,分析师 Notebook 逻辑要经过分析和工程两条队列,才能变成受治理的生产数据集。
团队约十人且没有 Data Architect;我设计平台路径,并承担事实上的架构负责人角色。
Enyquant 是一家为电力市场建设预测与决策支持系统的能源智能创业公司。作为数据平台负责人,我从零完成云与数据底座的架构、实现、部署和日常运维。60 天内向下游 SME 交付一个国家五年的电力运营与市场数据;定义并实现覆盖几乎所有数据集和模型训练流程的 PIT 可见性语义;随后把日常开发和运行从 Databricks + ADF 切换到单 VM DuckDB、Polars 与 DuckLake 架构,同等月度成本降低约 95%。
我在荷兰运营的独立咨询公司,通过它为企业建设和现代化数据平台、生产化复杂负载,并改善工程团队与业务团队之间的交付路径。工作覆盖架构、亲手实现、云基础设施、数据管道、CI/CD、治理和生产运维;客户包括 PVH、VodafoneZiggo 和 FedEx。2026 年暂停该公司的日常业务,把主要精力转向独立 AI 产品探索。
回到约十人的核心数据团队,继续演进 500+TB AWS 数据平台。团队没有专职 Data Architect,我承担事实上的架构负责人角色。用 YAML 契约、静态校验、实验层、数据质量控制和 DAG Factory 重构跨团队 Dashboard 交付路径,使代表性端到端交付周期从 4–6 周缩短到约 1–2 小时,并支撑 60+ Dashboard;SQL 完成后的 review 和部署约需 10–20 分钟。同时把获批的 PII 重新识别流程改造成事件驱动的 serverless 工作流,典型延迟从约 2 小时降至 5–10 分钟;约 90% 的降幅只指大账单中可识别的相关 AWS 资源成本,并非 AWS 总账单。参与 Azure Databricks 方案评审和迁移技术支持,但不负责整体迁移。
在由 100+ 名工程师、分析师、Data Scientist 和项目经理组成的 Data Tribe 中,参与持续运行的 1PB+ 核心数据平台;职责位于既有架构治理之内。持续开发和优化 Scala/Spark ETL framework;以数据工程师和云管理员身份建设并运维 AWS DMS Full Load + CDC 任务,支持数百 TB Oracle → Snowflake 搬迁;把 PowerCenter workflow 转换和前置校验接入 GitLab CI/CD,为至少 40 位开发者把反馈从数小时或数天缩短到几分钟,保守估算每周减少至少 40 小时手工工作;并为 4–5 位 Data Scientist 建设 JupyterHub + MLflow 服务。
加入时原有 Hadoop → AWS 搬迁已接近完成,工作重点是继续演进生产平台并形成可复用的工程模式。设计 Adobe、Salesforce 和 SAP 数据集成;开发幂等、配置驱动的 ETL;持续改善可观测性、数据质量和跨时区调度;参与 500+TB AWS 数据平台的日常演进和生产运维。
在原 TNT Digital 约 200 人组织中的 10–15 人 DE/DS 团队工作,负责 AWS 与 GCP 上的平台工程和数据交付。用 Terraform 管理基础设施,建设和运维 Spark/EMR ETL 与数据集成;在既有 GKE 集群上用 Kubernetes YAML 和 kubectl 开发、迁移和运维 Spark workload;支持 CI/CD、生产运维和 JupyterHub,并生产化 Data Scientist 的 Spark 逻辑。一个覆盖至少 175 个独立业务 case 的 Spark job,旧版运行 3 小时后 OOM 且无法完成,重构后完整负载在 5 分钟内完成。
参与建设 DIAL 企业数据平台,把不同部门分散的 ETL workload 整合到共享环境。将数据处理从 Hive 迁移到 PySpark,并开发 Python、Spark 和 Hive 管道;把一位同事每周约三天的手工 Excel 流程替换成约三分钟完成的 Python 程序。
在 bare-metal 基础设施上为企业客户交付和运维 Hortonworks HDP 集群。负责集群安装、配置和日常运行,开发 Hive/Spark ETL,并使用 Python、Ansible 和 Jenkins 自动化基础设施与交付任务;用 Robot Framework 建设端到端系统健康验证套件,替代安装后的重复手工检查,每周为团队节省 8 小时以上。
负责电信网络方案的技术验证与生产验收:评审高层和低层技术设计,在验收环境中协调实施与测试,在生产交接前识别技术和运维风险,并支持已验证系统受控进入生产。使用 Python 与 PostgreSQL 进行工程分析和自动化。
负责 Huawei HLR/HSS 电信核心网数据库系统的集成、验证和客户交付。担任 KPN 荷兰核心数据库切换项目的测试与交付负责人,该系统容量为 1600 万用户线;经过约七个月密集测试,识别数百个不同严重等级的缺陷,并参与设计和执行分阶段迁移与回滚方案。最终成功迁移 1200 万用户,整个生产切换期间零事故;同时参与售前技术支持和售后客户交付。
几项能代表我工作方式的结果;相关文章记录了背后的设计与交付决策。
2026 — present
2020 — 2022 & 2023 — 2025 (returned engagement)
2022 — 2024
2009 — 2012
Jun Hou, Jianhua Ge, Dewei Zhai, Jing Li
IEEE Transactions on Broadcasting · 2010 · Vol. 56, No. 2 · pp. 258–262
DOI: 10.1109/TBC.2010.2046970通信与信息系统硕士 — 西安电子科技大学,中国(2025 软科世界一流学科排名:通信工程全球第 4)。IDW 学历评估: 等同于荷兰 MSc Computing Science。
翟德炜的 AI 助理
可以聊天,也可以帮你给 Dewei 留言