聊聊我用AI工具链搞副业的一些野路子思考

前端散步者
2026-07-29 18:36
阅读 656

写在前面:本文约3000字,阅读大概需要10分钟。如果你也是个被房贷压得喘不过气、但又对技术充满热情的北漂/深漂程序员,希望这篇文章能给你一些启发。


先说说我是谁

先做个自我介绍吧。坐标深圳南山,在一家还算知名的互联网公司写代码,具体哪家就不说了,反正腾讯系的公司嘛,大家懂的都懂,卷是肯定的,但福利也还行。

去年咬牙在龙华买了个小两居,首付掏空了两家六个口袋,现在每个月房贷一万二。说实话,刚签完合同那会儿,晚上躺在床上盯着天花板,脑子里全是数字——房贷、车贷、彩礼、未来娃的教育基金……程序员35岁危机这个梗,以前当笑话听,现在是真的笑不出来了。

所以我开始琢磨副业。

你可能会说,程序员搞副业不就是接外包、写课、做独立开发嘛。没错,这些我都考虑过。但最近这一年,AI工具链的爆发给了我一个新的思路——能不能用AI工具组合出一套低成本的内容生产流水线?

今天这篇文章,就是想聊聊我这段时间折腾 Dify、Pika、ElevenLabs 和 AI 绘画的一些实践和思考。不吹不黑,有踩坑也有收获,纯个人经验分享。


为什么是这几个工具?

先说结论:我最终选择的这套工具链,核心逻辑是 "用最低的成本,做出还过得去的内容"

工具 用途 月成本 学习曲线
Dify AI应用编排/工作流 免费(自部署)/ $59(Pro) 中等
Pika AI视频生成 $8/月起
ElevenLabs AI语音合成 $5/月起
Midjourney/SD AI绘画 $10/月(MJ)或免费(SD) 中-高

为什么选这几个?因为我想做的事情是:做技术类的短视频内容

你可能会问,技术短视频有人看吗?说实话,我一开始也怀疑。但你看B站上那些讲Redis、讲K8s的UP主,粉丝量都不小。关键是——大部分技术视频的制作成本极高,要录屏、要剪辑、要配音、要做动画。一个人根本搞不定。

但AI工具链的出现,让"一个人就是一个团队"这件事变得可能了。


Dify:我的AI内容生产大脑

先说 Dify。这玩意儿我最早是在掘金上看到有人推荐的,当时刚好周末,房贷扣款短信叮的一声响了,我叹了口气,打开电脑开始研究。

Dify 本质上是一个 LLM 应用开发平台,你可以把它理解成一个 "AI工作流的可视化编排工具"。它最吸引我的点是:

  1. 支持RAG(检索增强生成):你可以把自己的知识库丢进去,让AI基于你的资料来生成内容
  2. 工作流编排:可以把多个AI能力串起来,形成一个自动化的pipeline
  3. 开源可自部署:这点很重要,白嫖党狂喜

我的实际用法

我用 Dify 搭了一个"技术文章转视频脚本"的工作流,大概长这样:

输入:一篇技术文章(Markdown格式)
  ↓
Step 1: 文章摘要提取(LLM节点)
  ↓
Step 2: 生成视频脚本大纲(LLM节点,带Prompt模板)
  ↓
Step 3: 逐段扩写脚本(LLM节点,控制语气和节奏)
  ↓
Step 4: 生成分镜提示词(LLM节点,输出给AI绘画工具)
  ↓
输出:完整的视频脚本 + 分镜描述

说实话,刚搭完跑通的时候,我激动得在工位上差点叫出来。旁边工位的兄弟看了我一眼,默默把耳机戴上了。

这里分享一个我踩过的坑:Prompt的设计非常关键。一开始我偷懒,直接让Dify"帮我把这篇文章改成视频脚本",出来的东西简直没法用——又长又无聊,像在读论文。

后来我花了整整一个下午调Prompt,加了这些约束:

你是一个技术短视频编剧。请遵循以下规则:
1. 开头3秒必须有一个"钩子",用反直觉的结论或痛点提问吸引观众
2. 每个知识点用"类比"来解释,假设观众是完全不懂的小白
3. 语气要口语化,像朋友聊天,禁止使用"首先、其次、综上所述"
4. 每段不超过80个字,因为要配合画面节奏
5. 在关键知识点处标注[画面提示],描述应该配什么图

加了这些之后,输出质量直接起飞。你看,AI工具好不好用,一半取决于工具本身,一半取决于你怎么用它。这道理跟写代码一样——框架再好,你写得烂也是屎山。


AI绘画:给视频配上灵魂画面

脚本有了,接下来是画面。这部分我主要用 Midjourney,偶尔也用 Stable Diffusion。

为什么不用 DALL-E 3?说实话,MJ 出图的艺术感和一致性确实更好。而且我主要做技术科普类的视频,画面风格偏"科技插画风",MJ 在这方面表现很稳。

我的出图流程

从 Dify 输出的分镜提示词,我会做一些微调,然后丢给 MJ。这里有个小技巧:建立一个自己的Prompt模板库

比如我常用的技术类配图风格:

A minimalist tech illustration of [具体概念], 
flat design style, dark background with neon blue and purple accents,
clean lines, modern aesthetic, 16:9 aspect ratio --v 6 --ar 16:9

这个模板我调了大概二十几次才满意。刚开始出的图要么太写实(像照片),要么太抽象(看不懂是啥)。后来我锁定了"扁平插画+暗色背景+霓虹色调"这个风格,出来的图既统一又有科技感。

踩坑提醒:MJ 的 --seed 参数很好用。如果你想保持系列视频的画面风格一致,记得记录每次出图的 seed 值。我有一次忘了记,结果同一个系列的两期视频,画风差了十万八千里,评论区直接有人问"是不是换人了"。

另外说一下 Stable Diffusion。如果你愿意折腾,SD 的上限其实比 MJ 高。我试过在本地跑 SD(用的我那张 RTX 4070,勉强能跑),配合 ControlNet 可以精确控制构图。但说实话,太费时间了。每次调参数、跑图、不满意再调,一张图搞半小时是常事。对于我这种想"批量生产"的人来说,MJ 的效率更高。

时间就是金钱,尤其是对于背着房贷的人来说。


ElevenLabs:让AI说出人话

画面有了,该配音了。这部分我选了 ElevenLabs,原因很简单——它的中文语音合成效果是目前我用过最好的

为什么不用国内的那些TTS服务?我试过某度、某讯的,说实话,一听就是"AI味"。那种平铺直叙、毫无感情的朗读,放在视频里简直是灾难。观众一听就知道是AI配的,直接划走。

ElevenLabs 有个很牛的功能叫 Voice Cloning(声音克隆)。你可以上传一段自己的录音,它会克隆你的声音。我上传了一段大概5分钟的录音(就是我自己读了一段技术文章),然后它生成的语音,乍一听还真像我说的。

当然,中文的克隆效果比英文差一些,语调偶尔会有点怪。但配合后期的微调,基本够用了。

配音工作流

我的做法是:

  1. 把 Dify 输出的脚本按段落拆分
  2. 每段单独生成语音(方便后期剪辑时调整节奏)
  3. 用 ElevenLabs 的 SSML 标记来控制停顿和重音

这里分享一个配置示例:

<speak>
  你知道为什么很多公司的Redis集群,<break time="0.3s"/>
  一到高峰期就崩吗?<break time="0.5s"/>
  <emphasis level="strong">问题往往不在Redis本身。</emphasis>
</speak>

加上 <break><emphasis> 之后,语音的自然度提升了一个档次。不再是那种机器人式的匀速朗读,而是有了"人味"。

一个小插曲:有一次我生成完配音,戴上耳机听效果,旁边测试组的同事路过,听了一耳朵说:"你这期视频自己录的啊?嗓子怎么变了?"我心想,这算是对 ElevenLabs 最高的赞美了吧。


Pika:让静态画面动起来

最后一步,用 Pika 把静态的AI绘画变成动态视频片段。

Pika 这个工具我真的是相见恨晚。它的操作极其简单——上传一张图,输入一段描述动作的提示词,等个几十秒,一张静态图就变成了3-4秒的动态视频。

比如我有一张"数据在管道中流动"的插画,丢给 Pika,提示词写:

Data particles flowing through the pipeline from left to right, 
smooth animation, glowing effect

出来的效果相当不错,数据粒子真的在管道里流动了,还带着发光效果。这种画面如果用传统方式做动画,AE 至少得搞一两个小时。

Pika 的局限

当然 Pika 也不是万能的。它目前有几个明显的问题:

  • 动作幅度不能太大:复杂的动作容易崩,画面会扭曲
  • 一致性一般:同一个角色在不同片段里可能长得不一样
  • 时长限制:单次最多生成4秒,长镜头需要拼接

但对于技术科普类视频来说,这些问题影响不大。因为我们的画面主要是概念性的插画,不需要复杂的角色动作。一个"服务器在运转"的动态图,一个"数据在传输"的流动效果,就够用了。


整套流程跑通后的效果

经过大概两周的调试,我把这套流程跑通了。来算一笔账:

环节 传统方式耗时 AI工具链耗时 成本
脚本撰写 3-4小时 30分钟(含调优) Dify免费
画面制作 4-6小时 1-2小时 MJ $10/月
配音录制 2-3小时 30分钟 $5/月
画面动效 3-5小时 1小时 $8/月
剪辑合成 3-4小时 2小时 剪映免费
总计 15-22小时 约6小时 约$23/月

效率提升了大概3倍,成本几乎可以忽略不计。

当然,这里要诚实地说:AI生成的内容,质量上限不如纯人工精雕细琢的作品。但它的下限也不低,尤其是对于"知识科普"这类内容,观众更在意的是信息密度和讲解清晰度,画面的精美程度反而是次要的。


一些掏心窝子的思考

折腾了这段时间,有几点感悟想和大家分享:

第一,AI工具的价值不在于替代你,而在于放大你。 我写代码十几年了,对技术概念的理解、对知识体系的把握,这些是AI替代不了的。AI帮我做的是那些"重复性高、创造性低"的环节——排版、配图、配音。它让我能把精力集中在"内容本身"上。

第二,工具链的组合比单一工具的深度更重要。 你不需要把每个工具都玩到极致。Dify 的工作流设计、MJ 的提示词技巧、Pika 的动态生成——每个工具你只需要掌握80%的核心功能,然后把它们串起来,就能产生1+1>2的效果。这其实跟微服务架构的思想很像——每个服务做好自己的事,通过编排产生更大的价值。

第三,先跑通MVP,再迭代优化。 我第一版视频出来之后,说实话,挺粗糙的。配音有点机械,画面衔接不够流畅,节奏也有点拖。但我还是发了。结果呢?播放量虽然不高,但评论区有人说"讲得挺清楚的,继续加油"。就这一句话,让我觉得值了。

第四,技术人做内容,最大的优势是"真懂"。 现在AI降低了内容生产的门槛,很多人都在做AI生成的内容。但大部分内容是"正确的废话"——看着挺像那么回事,但经不起推敲。作为程序员,我们最大的壁垒就是对技术的深度理解。AI可以帮你生成脚本,但判断脚本对不对、好不好,还得靠你自己。


写在最后

上周五晚上,我加完班回到家,已经快十一点了。打开电脑,看了看这个月副业的收入——不多,也就几千块,但够覆盖房贷的三分之一了。

更重要的是,在这个过程中,我重新找到了写代码之外的那种"创造的快乐"。白天在公司写业务代码,面对的是需求文档和JIRA看板;晚上回到家,面对的是自己的创意和AI工具,这种感觉真的很不一样。

最近我还在研究 Rust,感觉这门语言真的很有意思。所有权机制、零成本抽象、模式匹配……每次深入理解一个新概念,都有一种"啊,原来可以这样"的顿悟感。等这块吃得更透了,我打算用 Rust 重写一下我的内容生产工具链——现在的 Python 脚本跑得实在太慢了,而且类型系统太弱,改个字段名全项目搜索替换,太原始了。

如果你也是个背着房贷、但不想被生活磨平棱角的程序员,不妨也试试用AI工具做点什么。不一定非得是内容创作,独立开发、自动化工具、甚至帮小商家做个AI客服,都是路子。

这个时代最大的红利,就是AI把"一个人能做的事"的边界,推到了一个前所未有的广度。

而我们要做的,就是跳进去,游起来。

共勉。


如果这篇文章对你有帮助,欢迎点赞、收藏、转发。有问题可以在评论区交流,我看到都会回。

下期预告:《用Rust重写我的AI内容生产工具链——从Python迁移的踩坑实录》

评论 0

最热最新
暂无评论
前端散步者Lv.1
0
影响力
0
文章
0
粉丝