凌晨三点产品经理让我用Kubernetes跑图片生成

吴平
2026-09-22 08:39
阅读 1517

早上八点,深圳科技园,我端着冰美式翻昨晚的告警和工单,看到一条凌晨三点提的需求:产品经理问能不能在K8s集群里跑Imagen模型,给用户生成头像,下周上线。

团队Kubernetes玩得顺手,GPU节点也有几台A100。但这位产品同学以为跟部署Nginx差不多,改改YAML就能上。

先写了个Deployment,把Imagen推理服务打包成容器。镜像构建倒还好,基础PyTorch镜像加模型权重,推送到内网Harbor。但一跑就炸——OOMKilled。A100的80G显存被模型加载和中间张量吃满,Pod反复重启,一片CrashLoopBackOff。

查了半天,发现默认显存分配策略太保守,得手动设置:

env:
- name: PYTORCH_CUDA_ALLOC_CONF
  value: "max_split_size_mb:128"

再把批处理大小压到1。服务总算起来了,但一张头像生成要40多秒。

产品经理第二天问:“能不能快点?用户等不了。”

这是实打实的GPU算力在跑。后来搞了个队列,用KEDA根据请求积压量自动扩缩容,预热冷启动的Pod,平均响应压到十几秒。上线那天盯着Grafana面板,心跳比第一次约会还快。

现在回头看,这个需求奇葩归奇葩,但逼着我把K8s的GPU调度、HPA调优、镜像分层缓存从头到尾摸了一遍。那些让你半夜骂娘的需求,最后都变成了简历上最有底气的几行字。

不过说真的,下次产品再凌晨三点提需求,我可能会假装没看见。深圳的房租不便宜,命更值钱。

评论 0

最热最新
暂无评论
吴平Lv.1
0
影响力
0
文章
0
粉丝