凌晨三点产品经理让我用Kubernetes跑图片生成
吴平
2026-09-22 08:39
阅读 1517
早上八点,深圳科技园,我端着冰美式翻昨晚的告警和工单,看到一条凌晨三点提的需求:产品经理问能不能在K8s集群里跑Imagen模型,给用户生成头像,下周上线。
团队Kubernetes玩得顺手,GPU节点也有几台A100。但这位产品同学以为跟部署Nginx差不多,改改YAML就能上。
先写了个Deployment,把Imagen推理服务打包成容器。镜像构建倒还好,基础PyTorch镜像加模型权重,推送到内网Harbor。但一跑就炸——OOMKilled。A100的80G显存被模型加载和中间张量吃满,Pod反复重启,一片CrashLoopBackOff。
查了半天,发现默认显存分配策略太保守,得手动设置:
env:
- name: PYTORCH_CUDA_ALLOC_CONF
value: "max_split_size_mb:128"
再把批处理大小压到1。服务总算起来了,但一张头像生成要40多秒。
产品经理第二天问:“能不能快点?用户等不了。”
这是实打实的GPU算力在跑。后来搞了个队列,用KEDA根据请求积压量自动扩缩容,预热冷启动的Pod,平均响应压到十几秒。上线那天盯着Grafana面板,心跳比第一次约会还快。
现在回头看,这个需求奇葩归奇葩,但逼着我把K8s的GPU调度、HPA调优、镜像分层缓存从头到尾摸了一遍。那些让你半夜骂娘的需求,最后都变成了简历上最有底气的几行字。
不过说真的,下次产品再凌晨三点提需求,我可能会假装没看见。深圳的房租不便宜,命更值钱。
标签:技术分享KubernetesVibe CodingImagen
为你推荐
暂无相关推荐

评论 0