Iceberg 表能被 Spark 和 Flink 正常读写,只能证明接入完成,不能证明可以长期运行。流式任务每天产生几百个 snapshots,小批写入不断增加 data files,失败任务留下 orphan files,time travel 保留策略又阻止旧文件回收。三个月后,表仍能查,但规划越来越慢,存储账单一直涨,维护脚本谁也不敢改。
我认为平台真正要补的是表级运维闭环:从 metadata tables 读取健康信号,按每张表的负载和 SLA 选择维护动作,记录提交与删除证据,再验证查询和成本是否改善。它不是几条全局 cron,而是和写入一样正式的生产链路。