聊聊我用AI工具链搞副业的一些野路子思考
写在前面:本文约3000字,阅读大概需要10分钟。如果你也是个被房贷压得喘不过气、但又对技术充满热情的北漂/深漂程序员,希望这篇文章能给你一些启发。
先说说我是谁
先做个自我介绍吧。坐标深圳南山,在一家还算知名的互联网公司写代码,具体哪家就不说了,反正腾讯系的公司嘛,大家懂的都懂,卷是肯定的,但福利也还行。
去年咬牙在龙华买了个小两居,首付掏空了两家六个口袋,现在每个月房贷一万二。说实话,刚签完合同那会儿,晚上躺在床上盯着天花板,脑子里全是数字——房贷、车贷、彩礼、未来娃的教育基金……程序员35岁危机这个梗,以前当笑话听,现在是真的笑不出来了。
所以我开始琢磨副业。
你可能会说,程序员搞副业不就是接外包、写课、做独立开发嘛。没错,这些我都考虑过。但最近这一年,AI工具链的爆发给了我一个新的思路——能不能用AI工具组合出一套低成本的内容生产流水线?
今天这篇文章,就是想聊聊我这段时间折腾 Dify、Pika、ElevenLabs 和 AI 绘画的一些实践和思考。不吹不黑,有踩坑也有收获,纯个人经验分享。
为什么是这几个工具?
先说结论:我最终选择的这套工具链,核心逻辑是 "用最低的成本,做出还过得去的内容"。
| 工具 | 用途 | 月成本 | 学习曲线 |
|---|---|---|---|
| Dify | AI应用编排/工作流 | 免费(自部署)/ $59(Pro) | 中等 |
| Pika | AI视频生成 | $8/月起 | 低 |
| ElevenLabs | AI语音合成 | $5/月起 | 低 |
| Midjourney/SD | AI绘画 | $10/月(MJ)或免费(SD) | 中-高 |
为什么选这几个?因为我想做的事情是:做技术类的短视频内容。
你可能会问,技术短视频有人看吗?说实话,我一开始也怀疑。但你看B站上那些讲Redis、讲K8s的UP主,粉丝量都不小。关键是——大部分技术视频的制作成本极高,要录屏、要剪辑、要配音、要做动画。一个人根本搞不定。
但AI工具链的出现,让"一个人就是一个团队"这件事变得可能了。
Dify:我的AI内容生产大脑
先说 Dify。这玩意儿我最早是在掘金上看到有人推荐的,当时刚好周末,房贷扣款短信叮的一声响了,我叹了口气,打开电脑开始研究。
Dify 本质上是一个 LLM 应用开发平台,你可以把它理解成一个 "AI工作流的可视化编排工具"。它最吸引我的点是:
- 支持RAG(检索增强生成):你可以把自己的知识库丢进去,让AI基于你的资料来生成内容
- 工作流编排:可以把多个AI能力串起来,形成一个自动化的pipeline
- 开源可自部署:这点很重要,白嫖党狂喜
我的实际用法
我用 Dify 搭了一个"技术文章转视频脚本"的工作流,大概长这样:
输入:一篇技术文章(Markdown格式)
↓
Step 1: 文章摘要提取(LLM节点)
↓
Step 2: 生成视频脚本大纲(LLM节点,带Prompt模板)
↓
Step 3: 逐段扩写脚本(LLM节点,控制语气和节奏)
↓
Step 4: 生成分镜提示词(LLM节点,输出给AI绘画工具)
↓
输出:完整的视频脚本 + 分镜描述
说实话,刚搭完跑通的时候,我激动得在工位上差点叫出来。旁边工位的兄弟看了我一眼,默默把耳机戴上了。
这里分享一个我踩过的坑:Prompt的设计非常关键。一开始我偷懒,直接让Dify"帮我把这篇文章改成视频脚本",出来的东西简直没法用——又长又无聊,像在读论文。
后来我花了整整一个下午调Prompt,加了这些约束:
你是一个技术短视频编剧。请遵循以下规则:
1. 开头3秒必须有一个"钩子",用反直觉的结论或痛点提问吸引观众
2. 每个知识点用"类比"来解释,假设观众是完全不懂的小白
3. 语气要口语化,像朋友聊天,禁止使用"首先、其次、综上所述"
4. 每段不超过80个字,因为要配合画面节奏
5. 在关键知识点处标注[画面提示],描述应该配什么图
加了这些之后,输出质量直接起飞。你看,AI工具好不好用,一半取决于工具本身,一半取决于你怎么用它。这道理跟写代码一样——框架再好,你写得烂也是屎山。
AI绘画:给视频配上灵魂画面
脚本有了,接下来是画面。这部分我主要用 Midjourney,偶尔也用 Stable Diffusion。
为什么不用 DALL-E 3?说实话,MJ 出图的艺术感和一致性确实更好。而且我主要做技术科普类的视频,画面风格偏"科技插画风",MJ 在这方面表现很稳。
我的出图流程
从 Dify 输出的分镜提示词,我会做一些微调,然后丢给 MJ。这里有个小技巧:建立一个自己的Prompt模板库。
比如我常用的技术类配图风格:
A minimalist tech illustration of [具体概念],
flat design style, dark background with neon blue and purple accents,
clean lines, modern aesthetic, 16:9 aspect ratio --v 6 --ar 16:9
这个模板我调了大概二十几次才满意。刚开始出的图要么太写实(像照片),要么太抽象(看不懂是啥)。后来我锁定了"扁平插画+暗色背景+霓虹色调"这个风格,出来的图既统一又有科技感。
踩坑提醒:MJ 的 --seed 参数很好用。如果你想保持系列视频的画面风格一致,记得记录每次出图的 seed 值。我有一次忘了记,结果同一个系列的两期视频,画风差了十万八千里,评论区直接有人问"是不是换人了"。
另外说一下 Stable Diffusion。如果你愿意折腾,SD 的上限其实比 MJ 高。我试过在本地跑 SD(用的我那张 RTX 4070,勉强能跑),配合 ControlNet 可以精确控制构图。但说实话,太费时间了。每次调参数、跑图、不满意再调,一张图搞半小时是常事。对于我这种想"批量生产"的人来说,MJ 的效率更高。
时间就是金钱,尤其是对于背着房贷的人来说。
ElevenLabs:让AI说出人话
画面有了,该配音了。这部分我选了 ElevenLabs,原因很简单——它的中文语音合成效果是目前我用过最好的。
为什么不用国内的那些TTS服务?我试过某度、某讯的,说实话,一听就是"AI味"。那种平铺直叙、毫无感情的朗读,放在视频里简直是灾难。观众一听就知道是AI配的,直接划走。
ElevenLabs 有个很牛的功能叫 Voice Cloning(声音克隆)。你可以上传一段自己的录音,它会克隆你的声音。我上传了一段大概5分钟的录音(就是我自己读了一段技术文章),然后它生成的语音,乍一听还真像我说的。
当然,中文的克隆效果比英文差一些,语调偶尔会有点怪。但配合后期的微调,基本够用了。
配音工作流
我的做法是:
- 把 Dify 输出的脚本按段落拆分
- 每段单独生成语音(方便后期剪辑时调整节奏)
- 用 ElevenLabs 的 SSML 标记来控制停顿和重音
这里分享一个配置示例:
<speak>
你知道为什么很多公司的Redis集群,<break time="0.3s"/>
一到高峰期就崩吗?<break time="0.5s"/>
<emphasis level="strong">问题往往不在Redis本身。</emphasis>
</speak>
加上 <break> 和 <emphasis> 之后,语音的自然度提升了一个档次。不再是那种机器人式的匀速朗读,而是有了"人味"。
一个小插曲:有一次我生成完配音,戴上耳机听效果,旁边测试组的同事路过,听了一耳朵说:"你这期视频自己录的啊?嗓子怎么变了?"我心想,这算是对 ElevenLabs 最高的赞美了吧。
Pika:让静态画面动起来
最后一步,用 Pika 把静态的AI绘画变成动态视频片段。
Pika 这个工具我真的是相见恨晚。它的操作极其简单——上传一张图,输入一段描述动作的提示词,等个几十秒,一张静态图就变成了3-4秒的动态视频。
比如我有一张"数据在管道中流动"的插画,丢给 Pika,提示词写:
Data particles flowing through the pipeline from left to right,
smooth animation, glowing effect
出来的效果相当不错,数据粒子真的在管道里流动了,还带着发光效果。这种画面如果用传统方式做动画,AE 至少得搞一两个小时。
Pika 的局限
当然 Pika 也不是万能的。它目前有几个明显的问题:
- 动作幅度不能太大:复杂的动作容易崩,画面会扭曲
- 一致性一般:同一个角色在不同片段里可能长得不一样
- 时长限制:单次最多生成4秒,长镜头需要拼接
但对于技术科普类视频来说,这些问题影响不大。因为我们的画面主要是概念性的插画,不需要复杂的角色动作。一个"服务器在运转"的动态图,一个"数据在传输"的流动效果,就够用了。
整套流程跑通后的效果
经过大概两周的调试,我把这套流程跑通了。来算一笔账:
| 环节 | 传统方式耗时 | AI工具链耗时 | 成本 |
|---|---|---|---|
| 脚本撰写 | 3-4小时 | 30分钟(含调优) | Dify免费 |
| 画面制作 | 4-6小时 | 1-2小时 | MJ $10/月 |
| 配音录制 | 2-3小时 | 30分钟 | $5/月 |
| 画面动效 | 3-5小时 | 1小时 | $8/月 |
| 剪辑合成 | 3-4小时 | 2小时 | 剪映免费 |
| 总计 | 15-22小时 | 约6小时 | 约$23/月 |
效率提升了大概3倍,成本几乎可以忽略不计。
当然,这里要诚实地说:AI生成的内容,质量上限不如纯人工精雕细琢的作品。但它的下限也不低,尤其是对于"知识科普"这类内容,观众更在意的是信息密度和讲解清晰度,画面的精美程度反而是次要的。
一些掏心窝子的思考
折腾了这段时间,有几点感悟想和大家分享:
第一,AI工具的价值不在于替代你,而在于放大你。 我写代码十几年了,对技术概念的理解、对知识体系的把握,这些是AI替代不了的。AI帮我做的是那些"重复性高、创造性低"的环节——排版、配图、配音。它让我能把精力集中在"内容本身"上。
第二,工具链的组合比单一工具的深度更重要。 你不需要把每个工具都玩到极致。Dify 的工作流设计、MJ 的提示词技巧、Pika 的动态生成——每个工具你只需要掌握80%的核心功能,然后把它们串起来,就能产生1+1>2的效果。这其实跟微服务架构的思想很像——每个服务做好自己的事,通过编排产生更大的价值。
第三,先跑通MVP,再迭代优化。 我第一版视频出来之后,说实话,挺粗糙的。配音有点机械,画面衔接不够流畅,节奏也有点拖。但我还是发了。结果呢?播放量虽然不高,但评论区有人说"讲得挺清楚的,继续加油"。就这一句话,让我觉得值了。
第四,技术人做内容,最大的优势是"真懂"。 现在AI降低了内容生产的门槛,很多人都在做AI生成的内容。但大部分内容是"正确的废话"——看着挺像那么回事,但经不起推敲。作为程序员,我们最大的壁垒就是对技术的深度理解。AI可以帮你生成脚本,但判断脚本对不对、好不好,还得靠你自己。
写在最后
上周五晚上,我加完班回到家,已经快十一点了。打开电脑,看了看这个月副业的收入——不多,也就几千块,但够覆盖房贷的三分之一了。
更重要的是,在这个过程中,我重新找到了写代码之外的那种"创造的快乐"。白天在公司写业务代码,面对的是需求文档和JIRA看板;晚上回到家,面对的是自己的创意和AI工具,这种感觉真的很不一样。
最近我还在研究 Rust,感觉这门语言真的很有意思。所有权机制、零成本抽象、模式匹配……每次深入理解一个新概念,都有一种"啊,原来可以这样"的顿悟感。等这块吃得更透了,我打算用 Rust 重写一下我的内容生产工具链——现在的 Python 脚本跑得实在太慢了,而且类型系统太弱,改个字段名全项目搜索替换,太原始了。
如果你也是个背着房贷、但不想被生活磨平棱角的程序员,不妨也试试用AI工具做点什么。不一定非得是内容创作,独立开发、自动化工具、甚至帮小商家做个AI客服,都是路子。
这个时代最大的红利,就是AI把"一个人能做的事"的边界,推到了一个前所未有的广度。
而我们要做的,就是跳进去,游起来。
共勉。
如果这篇文章对你有帮助,欢迎点赞、收藏、转发。有问题可以在评论区交流,我看到都会回。
下期预告:《用Rust重写我的AI内容生产工具链——从Python迁移的踩坑实录》

评论 0