我在深圳搬砖之余,用Cursor硬啃下了机器学习
上个月在一个技术分享会上,朋友问我:“你天天用Cursor,怎么不学学机器学习?”我愣住了。但他说得对,工具都在帮我们写代码了,不懂原理迟早被淘汰。于是,我开始了白天写增删改查,晚上啃ML的两个月。
选对学习路线比努力更重要
刚开始我犯了错:直接啃《深度学习》花书,被数学公式劝退。一位算法朋友建议先建立直觉,推荐了《Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow》,代码示例贴近实际工作。我还用Claude梳理知识图谱,按重要性排序知识点,效果意外地好。
搭建环境踩的坑
我的2019款MacBook Pro装TensorFlow时遇到兼容性问题。学乖后用Miniforge创建环境:
conda create -n ml_env python=3.9
conda activate ml_env
conda install -c apple tensorflow-deps
pip install tensorflow-macos
pip install tensorflow-metal
用Cursor写ML代码时,代码补全对记不住API的新手很友好。
第一个实战项目:预测深圳房价
我从链家爬了两万多条深圳房源数据。数据清洗时,直接dropna()删除了30%数据,后来改为分列处理:
df['总价'] = df['总价'].fillna(df.groupby('区域')['总价'].transform('median'))
df['建筑面积'] = df['建筑面积'].apply(lambda x: np.nan if x == '暂无数据' else float(x))
模型选择走了弯路。一开始用XGBoost,R²达到0.89,但犯了数据泄露错误,把“参考总价”喂进去了。调整后去掉价格相关字段,换用可解释性更好的随机森林,R²稳定在0.82。做房价预测,能解释清楚为什么值这个价,比准确率高更重要。
模型调优的真实感受
调参像炼丹。GridSearchCV跑一次二十多分钟,后来先用RandomizedSearchCV缩小范围,再用GridSearchCV精细搜索。最优参数:n_estimators为300,max_depth为15,min_samples_split为5,min_samples_leaf为2。模型上线后,预测价与实际成交价平均差不到15万,那一刻觉得熬夜值了。
一些掏心窝子的话
最重要的是建立了数据驱动的思维方式。学了ML后,用Cursor写业务代码反而更顺手,因为理解了AI辅助编程的原理,知道何时信任它的建议。最近公司讨论用大模型重构规则引擎,我至少能听懂,还能问出“embedding维度怎么选”这种问题。
我的建议:别等准备好,直接上手干项目。找个感兴趣的数据集,理论在实践中补。遇到问题可以问问Claude,回答很靠谱。凌晨两点写完这篇文章,窗外深圳湾夜景挺好看,想到自己多了项技能,搬砖也没那么累了。

评论 0