在小县城远程办公两年,我靠这三件套把AI探索成本打了下来
去年十月深夜,我盯着屏幕上的OOM报错,GPU风扇呼呼转。这就是我,一个从北京回到四线小县城的自由开发者。失去了公司的算力资源,全靠自己那台RTX 3060撑着,连跑个GLM-4做本地推理都扛不住。
转机:Ollama 一键搞定本地部署
今年三月,我在GitHub上发现了Ollama。一行命令就解决了我的焦虑:
ollama run glm4:9b
没有环境配置和依赖地狱。它把模型量化、推理优化、API服务全打包,对消费级显卡极其友好。9B的量化模型在我的3060上显存占用才6G出头,推理流畅。
开窍:用 LangGraph 构建干活儿的智能体
有了本地部署基础,我开始用LangGraph让LLM真正工作。它把Agent决策流程抽象为有向图,比过度封装的LangChain更灵活可控。
我接了个自动分析合同条款的项目,用两周搭出原型。架构分三层:意图识别、执行处理、结果整合。关键代码如下:
from langgraph.graph import StateGraph, END
workflow = StateGraph(AgentState)
workflow.add_node("intent_parser", parse_intent)
workflow.add_node("contract_analyzer", analyze_contract)
workflow.add_node("clause_checker", check_clause)
workflow.add_node("result_merger", merge_results)
workflow.add_conditional_edges(
"intent_parser",
route_intent,
{
"analyze": "contract_analyzer",
"check": "clause_checker",
"summary": "result_merger"
}
)
所有模型调用走Ollama本地API,数据不出电脑。客户对数据安全要求极高,得知是纯本地处理后当场签约。
真金白银的坑
Agent曾因理解歧义陷入死循环,在两个节点间反复横跳,日志爆了2个G。后来加了最大迭代次数和状态计数器解决。Ollama默认单worker,并发会超时,需设置环境变量OLLAMA_NUM_PARALLEL=4。电费也是成本,3060满载一天约3度电,后来我把推理任务调到夜间谷电时段,省下三分之一开销。
生存策略与启发
这套Ollama + GLM + LangGraph的技术栈,是我的生存策略。同样跑合同分析,用云端GPT-4 API月费至少2000元,本地方案除电费外几乎零成本,且响应更快、数据更安全。它还让我明白,消费级硬件只要思路对也能玩出花样。上个月我搭了个个人知识库助手,检索效率飙升。
方案局限在于处理超长上下文或多模态任务时,本地9B模型会吃力。但大部分场景够用就好,别被技术焦虑裹挟。在小县城远程办公两年,我最大的感悟是:技术探索的核心是找到适合自己场景的最小可行方案。这套工具刚好够我体面地接项目、做产品,让我能继续在这条路上走下去。

评论 0