RaydoRaydo Book

从空白画布到跑通:数据处理型 workflow 实操范例

用一条读取、清洗、整理、复核、交付的数据流演示数据处理型 workflow。

这一页用一个很常见的任务来演示:

“读取一份表格或数据清单,做清洗整理,输出成可复核的结果包。”

第一步,先想清楚你是在处理什么数据

最少先定下来:

  • 数据来自哪里;
  • 想保留哪些字段;
  • 需要清洗什么问题;
  • 最终是给人看,还是要写回外部系统。

第二步,主干要把读取、变换、交付拆开

推荐主干:

  1. Goal / brief
  2. Read capability,或表格 / 文档读取能力
  3. Data operation
  4. Review
  5. Delivery

如果后面要写回表格或外部系统,再加:

  1. Approval
  2. Write / sync capability

第三步,Data operation 不要偷懒

数据处理型 workflow 最值钱的地方,往往就在 Data operation。

它至少应该帮你完成其中几件事:

  • 统一字段名
  • 清理空值
  • 去重
  • 重组结构
  • 为下游生成稳定输出

第四步,第一轮只跑小样本

第一次不要直接吃整批数据。

先用小样本确认:

  • 读得进来;
  • 变得出来;
  • review 看得懂;
  • delivery 接得住。

第五步,第一次跑通的合格标准

  • 输入和输出字段明确;
  • 清洗逻辑能被复现,不是临场手工处理;
  • review 能看出结果值不值得继续;
  • 如需写回,审批位置正确。

这条实操里最容易踩的坑

为什么会发生怎么避开
读取后直接交付以为原始表就能直接给下游中间加 data operation
一边清洗一边写回排错时根本不知道哪一步出问题把 transform 和 write 拆开
第一次就上全量数据失败后很难复盘先跑小样本
外部写回前没审批容易把脏结果写出去写回前加 approval

一条最稳的试跑建议

  • 先读取;
  • 再清洗;
  • 再 review;
  • 最后才写回或交付。

顺序越清楚,排错越快。

配套阅读