/writing
工作笔记。
在工作里弄明白、觉得值得写下来的东西。没有教程,没有清单 — 只有那些"当年要是有人告诉我就好了"的部分。

2026-09-03
边开车边换轮胎:我的 Oracle → Snowflake 迁移复盘
通过自动化改造 Oracle → Snowflake 迁移流程,减少对持续开发的干扰和手工版本漂移,支持项目按期完成迁移。
#data-engineering#snowflake#migration#ci-cd

2026-09-01
大扫除:一种结构化删除冗余的方法
用使用证据、删除反事实和保留义务,判断代码、文件、文档或机制该保留、修复、归档、合并还是删除。
#AI-agent#engineering-practice#skills#code-maintenance

2026-08-26
GDPR 数据流程:PII 重新识别从每小时轮询转向事件驱动
把一条依赖常驻 EMR 与 Aurora、符合 GDPR 管控要求的 PII 重新识别流程,重构为 S3 Event、Step Functions、DynamoDB 与 EMR Serverless:典型时延从约两小时降到 5–10 分钟,大账单中可识别的相关 AWS 资源成本降低约 90%。
#data-engineering#aws#gdpr#serverless

2026-08-26
当 AI 协作 Repo 开始让自己的规则失去权威
我重构了一套公司级 AI 协作 Repo:重新划分 Skill 归属、建立统一准入门槛,并让 Skill 正文减少 51.7%,同时保留真正改变 Agent 行为的能力。
#ai#governance#agents#engineering

2026-08-20
三个让我和 AI Agent 更好协作的 Skill:大扫除、抢凳子与白板
AI 能更快地产生代码,也能更快地产生冗余、冲突和误解。我用三个小 Skill 分别回答:它该不该存在、谁现在可以动它、以及系统到底是怎么工作的。
#AI-agent#engineering-practice#skills#mental-model

2026-07-27
我把数据平台从 Databricks 迁到一台 VM,月成本降低了 95%
一次个人数据平台迁移复盘:AI Agent 放大了探索式开发的成本风险,我如何用更小的运行面缩短反馈周期。
#data-platform#DuckDB#DuckLake#Airflow#cloud-cost#AI-coding

2026-06-08
Transformer 不只是关于语言
金融交易是真实事件的记录。交易基础模型可能学到这些事件背后的隐藏结构。
#ai#finance#llm

2026-06-07
大模型不是知识仓库,而是关系空间
我目前对 GPT 的一个理解:它最重要的产物不是事实库,而是一张关于世界关系的高维地图。
#ai#llm#learning

2026-05-21
把连续 6 次 OOM 的入库任务优化到 52 秒跑完
一次 Parquet 到 Postgres 的重写:从批到流,从 Python 到 Rust。
#data-engineering#rust#postgres#serverless

2026-05-15
凭据放 Keychain,不放 .env
230 行 Bash 把 macOS Keychain 包成一个手感顺的 CLI:用 $(secret get foo) 把 API key 注入到一条命令里,用完即逝,不进 shell 环境、不进 history、不进 .env。
#tooling#security#shell

2026-05-13
用 CLI,不用 MCP
把现成的 Outlook MCP 退役,换成自己写的 250 行 Rust CLI。LLM 实际看到的邮件正文从 6,200 字节降到约 500,常驻 context 里的 700 token tool schema 也省了。
#ai#agents#tooling

2026-05-13
新 Dashboard:从 4–6 周缩短到 1–2 小时
在某知名时尚客户,C 团队的 DA 先用 notebook 开发,DE 再用 PySpark 重写并接入 Airflow。重构后,端到端交付约需 1–2 小时,日常数据也能在业务上班前准备好。
#data-engineering#process#platform

2026-05-10
小成本,认真做:这个网站和 Agent 是怎么搭出来的
一套小型 Cloudflare + DeepSeek 架构,以及确定性上下文、可编辑行为、线上评估和站内人工转接。
#infra#cloudflare#ai
