Dewei Zhai

/cv

Ik verander trage, kostbare en versnipperde datadelivery in betrouwbare productiesystemen.

10 jaar ervaring met 500TB–1PB dataplatformen op AWS, Azure, GCP en Alibaba Cloud: van zelfstandig een startupfundering bouwen tot kernplatformen evolueren in dataorganisaties van 100+ mensen.

Mijn voordeel is dat ik mismatches vind tussen de businessloop, workload-lifecycle, technische architectuur en teamgrenzen. Ik vertaal die diagnose naar een eenvoudiger deliverysysteem met expliciete governance en meetbare resultaten.

De omgevingen waarin ik heb gewerkt

Van zelfstandig een fundament bouwen tot een live platform verbeteren in een grote organisatie.

Startup · 0 → 1 · Enyquant

Een model-ready nationale dataset in 60 dagen

Een nieuw energiebedrijf had vijf jaar operationele en marktdata voor één volledig land nodig om prijsvoorspellingsmodellen te trainen.

Er was geen bestaand platformteam; ik leverde het platform end-to-end, van architectuur en code tot deployment en dagelijks beheer.

  • — Binnen 60 dagen ontvingen SMEs de volledige DuckDB-dataset.
  • — Point-in-time visibility vanaf nul gedefinieerd voor vrijwel alle data- en trainingsflows.
  • — SMEs trainden werkende modellen met de release; verdere details blijven vertrouwelijk.

Grote dataorganisatie · evolueren in productie · VodafoneZiggo

Honderden TB migreren en feedback van uren naar minuten brengen

Een Data Tribe van 100+ mensen migreerde honderden TB van Oracle naar Snowflake terwijl het gedeelde 1PB+ platform live bleef.

Als cloud administrator en data engineer ondersteunde ik dit met AWS DMS Full Load + CDC en bouwde ik workflowautomatisering en vroege validatie.

  • — Mijn verantwoordelijkheid omvatte DMS-taken, mappings, monitoring, recovery, reconciliatie en productieondersteuning; de bredere migratie was een gezamenlijk project van meerdere teams.
  • — PowerCenter-conversie en checks in GitLab CI/CD voor minstens 40 developers.
  • — Feedback van uren/dagen naar minuten; conservatief minstens 40 uur handwerk per week verwijderd.

Grotere organisaties · klein kernteam · PVH · FedEx

Van 4–6 weken naar circa 1–2 uur

Bij PVH ging notebooklogica door aparte analyst- en engineeringqueues voordat zij governed productiedata werd.

In een team van circa tien zonder Data Architect ontwierp ik het platformpad en vervulde ik feitelijk die architectuurrol.

  • — YAML-contract, statische checks, experiments-laag, datakwaliteit en DAG factory vervingen het herschrijfpad.
  • — End-to-end delivery daalde van 4–6 weken naar circa 1–2 uur voor een platform met 60+ dashboards; review en deployment kostten circa 10–20 minuten zodra de SQL gereed was.

Track record

  1. Feb 2026 — now

    Data Platform Owner & Platform ArchitectEnyquant

    Enyquant bouwt forecasting- en decision-supportsystemen voor elektriciteitsmarkten. Als Data Platform Owner bouwde ik de cloud- en datafundering vanaf nul: architectuur, implementatie, deployment en dagelijks beheer. Binnen 60 dagen leverde ik vijf jaar nationale elektriciteitsdata, definieerde point-in-time visibility voor vrijwel alle datasets en modeltrainingen en verplaatste dagelijks werk van Databricks + ADF naar één VM met DuckDB, Polars en DuckLake, met circa 95% lagere vergelijkbare maandkosten.

  2. Feb 2019 — Jan 2026

    OwnerDewei Consulting B.V.

    Mijn zelfstandige adviesbedrijf in Nederland, waarmee ik organisaties hielp dataplatformen te bouwen en moderniseren, complexe workloads te productioniseren en delivery tussen engineering en business te verbeteren. Het werk omvatte architectuur, hands-on implementatie, cloudinfrastructuur, pipelines, CI/CD, governance en productiebeheer voor onder meer PVH, VodafoneZiggo en FedEx. De activiteiten zijn in 2026 gepauzeerd toen mijn focus verschoof naar onafhankelijke AI-productexploratie.

  3. Nov 2023 — Oct 2025

    Lead Data EngineerPVH Corp · 2nd engagement

    Teruggekeerd naar een kernteam van circa tien mensen rond een 500+TB AWS-platform. Zonder vaste Data Architect fungeerde ik als feitelijke architectuurlead. Ik herontwierp een dashboarddeliverypad met YAML-contracten, statische validatie, een experimentenlaag, datakwaliteitscontroles en een DAG factory; een representatieve end-to-end cyclus daalde van 4–6 weken naar circa 1–2 uur en ondersteunde 60+ dashboards. Zodra de SQL gereed was, kostten review en deployment circa 10–20 minuten. Een goedgekeurde PII re-identificatieflow werd event-driven serverless: circa twee uur werd 5–10 minuten en gerelateerde AWS-kosten daalden circa 90%. Ik nam deel aan Azure Databricks-reviews en bood technische migratiesupport, zonder eigenaar van de volledige migratie te zijn.

  4. Sep 2022 — Jan 2024

    Senior Data EngineerVodafoneZiggo

    Werkte binnen een Data Tribe van 100+ mensen aan een live 1PB+ kernplatform, binnen bestaande architectuurgovernance. Ik verbeterde een Scala/Spark ETL-framework, bouwde en beheerde AWS DMS Full Load + CDC voor een Oracle → Snowflake-migratie van honderden TB en bracht PowerCenter-conversie en vroege validatie naar GitLab CI/CD. Voor minstens 40 developers ging feedback van uren of dagen naar minuten, conservatief 40+ uur handwerk per week minder. Ook bouwde ik JupyterHub + MLflow-services voor 4–5 data scientists.

  5. Dec 2020 — Aug 2022

    Senior Data EngineerPVH Corp · 1st engagement

    Begonnen toen de oorspronkelijke HadoopAWS-migratie bijna klaar was, met focus op evolutie van het productieplatform en herbruikbare engineeringpatronen. Ik ontwierp Adobe-, Salesforce- en SAP-integraties, ontwikkelde idempotente configuration-driven ETL, verbeterde observability, datakwaliteit en scheduling over tijdzones en droeg bij aan de dagelijkse evolutie en productieoperatie van het 500+TB platform.

  6. Aug 2018 — Nov 2020

    Data EngineerFedEx (formerly TNT Digital International)

    Werkte in een DE/DS-team van 10–15 mensen binnen de voormalige TNT Digital-organisatie van circa 200 mensen. Ik beheerde AWS/GCP-infrastructuur met Terraform, bouwde Spark/EMR ETL en integraties, draaide Spark-workloads op een bestaand GKE-cluster en ondersteunde CI/CD, productie en JupyterHub. Een Spark-job met minstens 175 businesscases faalde eerder na drie uur met OOM; de herbouwde versie voltooide alles binnen vijf minuten.

  7. Feb 2018 — Jul 2018

    Data EngineerABN AMRO

    Droeg bij aan DIAL, een enterprise-platform dat versnipperde ETL van afdelingen naar een gedeelde omgeving bracht. Ik migreerde workloads van Hive naar PySpark, bouwde Python/Spark/Hive-pipelines en verving een handmatig Excel-proces van circa drie dagen per week door een Python-proces van ongeveer drie minuten.

  8. Nov 2016 — Jan 2018

    Big Data ConsultantKPN

    Leverde en beheerde Hortonworks HDP-clusters op bare-metal voor zakelijke klanten. Ik installeerde en configureerde clusters, ontwikkelde Hive/Spark ETL, automatiseerde infrastructuur en delivery met Python, Ansible en Jenkins en bouwde een end-to-end Robot Framework health-validatiesuite die repetitieve controles verving en het team meer dan acht uur per week bespaarde.

  9. Oct 2012 — Nov 2016

    Network Quality EngineerKPN

    Verantwoordelijk voor technische validatie en productieacceptatie van telecomoplossingen: reviewde high- en low-level designs, coördineerde implementatie en tests, identificeerde risico’s vóór overdracht en ondersteunde gecontroleerde ingebruikname. Gebruikte Python en PostgreSQL voor analyse en automatisering.

  10. Jun 2009 — Oct 2012

    Software Test EngineerHuawei

    Werkte aan integratie, verificatie en klantdelivery van Huawei HLR/HSS core-network databases. Als test- en delivery-lead voor een grote KPN-cutover van een systeem met capaciteit voor 16M aansluitingen voerde ik circa zeven maanden intensieve tests uit, vond honderden defects en hielp staged migratie- en rollbackprocedures ontwerpen en uitvoeren. Uiteindelijk werden 12M subscribers gemigreerd met nul productie-incidenten; daarnaast ondersteunde ik pre-sales en post-sales klantdelivery.

Geselecteerd werk

Enkele resultaten die laten zien hoe ik werk. Gerelateerde artikelen beschrijven de ontwerp- en deliverykeuzes erachter.

Tech stack

Cloud
AWS (deepest), Azure, Alibaba Cloud, GCP
Lakehouse
Databricks, Snowflake, Unity Catalog, Iceberg, DuckLake, DuckDB
ETL
Spark, Polars, dbt, Glue, Kafka, AWS DMS (CDC)
Languages
Python, SQL, TypeScript, Scala, Shell, Solidity, Cython
Orchestration
Airflow, ADF, Step Functions, Oozie
IaC
Terraform, AWS CDK, CDKTF, Ansible
CICD
GitHub Actions, GitLab CI/CD, Jenkins
Quality
PyDeequ, Great Expectations

Publicaties

Certificeringen

  • AWS Certified Solutions Architect — Associate
  • Databricks Certified Associate Developer for Apache Spark
  • Databricks Certified Data Engineer Associate
  • — Certified Associate in Python Programming

Opleiding

MSc, Communication & Information Systems — Xidian University, China (Telecommunication Engineering: wereldwijd #4 in ShanghaiRanking's Global Ranking of Academic Subjects 2025). IDW-evaluatie: gelijkwaardig aan MSc Computing Science (NL).