云雀 · 轻技术笔记
咱们日常使用AI,需要避开哪些坑?
用了四年 AI,什么姿势对什么姿势错,踩过的坑够写本书了。
最大的感受是:大多数人方向就是错的。你以为你在用 AI,其实你在被 AI 驯化,它给你什么你就收什么,你以为这是「效率」,其实是偷懒。
说五个最常见的。
一、把 AI 当搜索引擎用
你问 AI「RAG 是什么」,它给你一段八股文。你问「帮我写个请假邮件」,它给你一封滴水不漏但一眼假的邮件。
这不是 AI 的问题,是你的问题。
AI 没有「事实」,只有「概率」。它每次回答都是从海量文本里拼出来的「听起来合理的话」,不保证对,更不保证新。你以为你在查资料,其实你在被喂一个包装得很专业的答案。
我见过最夸张的一个人,每次开会前让 AI 列 agenda,结果 AI 列的 agenda 和上次一模一样,因为它的语料里这种模板最多。他照着念了三场会议,下面的人以为他江郎才尽了。
还有一个更隐蔽的问题:你用 AI 查你已经了解的东西,它给你一个错误答案你一眼就能看出来。但你用 AI 查你不了解的领域,你根本没有判断能力,只能照单全收。这才是最危险的——你用 AI 给自己挖了一个信息茧房,还觉得在高效学习。
正确用法:把 AI 当思维伙伴,不是信息源。你跟它讨论,它逼你把思路说清楚,这个过程才是价值。
不是让 AI 给你答案,是让它帮你思考。
我每次用 AI 查技术问题,最后都会让它「说人话解释一遍我刚才的问题是什么、你给的是什么方案、为什么这个方案比其他方案更好」。这个动作本身就是一次思维整理,比答案本身值钱十倍。
你跟一个什么都不懂的人讲清楚一个问题,往往比你自己想清楚更难,这个难度就是价值所在。用 AI 也是这样:让它当你的听众,你来说服它,说的过程里你自己的思路就清晰了。
二、一次 prompt 说清楚所有需求
试了一次 AI 效果不好就骂 AI 是废物,这是第二个大坑。
好的 AI 使用是对话过程。你给一个粗糙的方向,它给一个粗糙的结果,你指出哪里不对,它修正,三四个来回才能拿到真正能用的东西。
prompt 不是写产品需求文档,是对话。
我现在养成了习惯:第一轮只给背景和目标,让它先出一个方向,我看方向对不对。第二轮针对方向提要求,第三轮再精修。超过三轮我就停下来想——是不是我自己要什么就不清楚?
分段说,边走边看,比一次性说清楚更高效,也更准确。
这里面有个反直觉的真相:有时候你把问题说清楚的过程,比答案本身更有价值。你让 AI 帮你理清思路,AI 给了你一个烂答案,但你在这个过程里把自己的思路也理清了——你赚了。
真正会用 AI 的人,不是那些能一次写出完美 prompt 的人,而是那些知道什么时候该继续、什么时候该换方向、什么时候该放弃的人。
还有一个实际技巧:给 AI 设定角色的时候,别用「你是一个有20年经验的资深工程师」这种套话,AI 一听就知道是 prompt 技巧。你换成「你是一个对新技术特别谨慎、每次用新框架都要先问为什么要用而不是能不能用的工程师」,它反而更知道你想要什么风格。
三、迷信「超级 prompt」
网上有大量卖课的,教你一套模板能让 AI 脱胎换骨。什么角色扮演开场,什么 Few-shot 示例堆三个,什么「请一步步思考」。
坦白说,大多数没用。
Prompt 技巧有边际效应——结构化输出、Few-shot、角色设定确实能提升效果,但核心从来不是 prompt 技巧,是你自己知不知道你要什么。
你自己脑子不清楚,prompt 再花哨也救不了。
prompt 是放大器,不是替代品。你自己值 60 分,放大器能帮你到 75 分。你自己值 30 分,放大器只能帮你把 30 分的错误放大到 300 分。
见过太多人花两小时调一个完美 prompt,然后用这个 prompt 处理一个三分钟就能手动解决的事。这不叫高效,这叫用高射炮打蚊子,打完了还觉得自己特别有生产力。
真正有用的 prompt 技巧就三个:
第一,给清楚背景和约束条件,别让 AI 猜你想要什么。第二,让它先出一个方向,你看方向对不对再继续。第三,给它反馈,让它知道哪里不对。
没了。剩下的都是花架子。
你看到那些超级 prompt 的效果演示,觉得特别厉害——但你没看到的是,他们测试的那个问题恰好是那个 prompt 擅长的。大部分人拿到模板之后套用到自己的问题上,发现根本不是那么回事,然后骂 AI 不行。其实是 prompt 和问题不匹配,不是 AI 不行。
四、所有问题都用最强模型
DeepSeek R1 很强,GPT-4o 很强,但你查个日期、问个地名也调最强模型,这叫用牛刀杀蚊子。
大模型贵、慢、幻觉率高。小问题用小模型,省钱省时间,效果一样。
我把任务分成三类:
查东西、问事实:用免费的小模型就够。查个日期、问个术语、确认一个概念,GPT-4o 和 Gemini Flash 给的答案没有本质区别,但价格差了几十倍。省下来的钱和时间用在真正需要推理的任务上。
需要推理和分析:这类必须用最强模型。写方案、做分析、对比技术选型,让 DeepSeek R1 或者 GPT-4o 来,给足上下文,让它多步骤推理。我现在的习惯是给完上下文之后,让它先说说它打算怎么做,我看逻辑再让它继续。减少幻觉最有效的方法就是看它的思路而不是直接拿结论。
写代码初稿、头脑风暴:随便哪个都行。代码初稿这种东西,GPT-3.5 就能跑个七成对,剩下的让人来 review。这才是正常分工——AI 产出,人来把关。
让最强模型做最有价值的事,把简单任务释放出来。
一个更具体的数据:我在写代码的时候,同样一段功能描述,让 GPT-4o 直接写 vs 让 Gemini Flash 写然后我 review,后者花的时间更少,因为我在 review 的过程中发现了好几个隐藏的边界情况。用大模型直接写反而会因为太顺畅而忽略这些问题。
还有一个我踩过的坑:有些需要推理的任务,比如「分析这段代码哪里可能有性能问题」,用太快太强的模型反而不好,它给你一个特别完整特别自信的分析,你反而不会去质疑它。用稍微弱一点的模型,它会给你一些不那么确定的表述,反而能触发你自己的思考。
五、把 AI 输出当最终成果
AI 写代码可能有 bug,写文章可能有事实错误,画图可能有版权问题。
你把 AI 输出直接交出去,出问题是你的责任。
我现在的硬规矩:AI 给的东西我看三遍再交。
第一遍看逻辑,有没有明显胡说。第二遍看细节,数字对不对、名字准不准。第三遍看语气,像不像我会说的话。
最后那遍最重要——AI 的文风和你的文风不一致,读者一眼就知道这不是你。在知乎尤其明显,一篇专业回答用的是「作为一位深耕领域多年的从业者」这种开头,直接社死。
还有一个更隐蔽的问题:AI 的措辞有一种特定的「正确感」,它会让你觉得自己写的东西特别权威,但实际上你在用权威感掩盖内容的空洞。这种文章发出去,短期数据可能不错,长期会损伤你的专业形象——因为它不是你的,只是你签了名。
更具体一点:AI 写的代码,看起来特别工整,注释特别全,但运行起来就是有 bug。原因是 AI 写代码追求的是「看起来对」,不是「实际上对」。注释越全的代码,往往越危险——因为它是在解释自己的逻辑,而不是解释业务逻辑,开发者很容易被带着走。
AI 是实习生,不是主管。它给你初稿,你审核,这是标准流程。跳过 review 就是把自己的专业声誉押在 AI 的随机发挥上。
六、不了解 AI 的边界就盲目信任
这个坑和第五个不一样。第五个是「AI 给的东西没看清楚就交出去」,这个是「根本不知道 AI 会在哪里出错」。
AI 在不同任务上的可靠性差异极大。了解它会在哪里出问题,比知道它能做什么更重要。
比如:我问 AI「GPT-4o 的上下文窗口是多少」,它给我一个数字——我需要知道这个数字可能来自它训练时的一个旧版本,实际数字可能已经变了。AI 给的信息有时间戳,它自己不知道。
比如:我让 AI 写一段正则表达式,它写得特别自信,看起来特别对,但正则表达式这种精确匹配的东西,一点细节错误就会导致整个逻辑失效。AI 在这种需要精确度的任务上,反而比在模糊的分析任务上更危险,因为它给的东西看起来特别「正确」。
比如:我让 AI 总结一篇论文的核心贡献——它很可能会把论文里没有的内容也编进去,看起来像是在总结,实际上是在创作。我有一次让 AI 总结一篇强化学习的论文,它总结出了五个贡献,其中两个是它自己发明的,论文里根本不存在。
比如:我让 AI 帮我分析一个日志文件找出异常——AI 很可能会编造一些根本不存在的错误代码,然后给出一套完整的分析逻辑,看起来特别专业,但整个分析是建立在虚假数据上的。这种时候你要是没有原始日志的判断力,就会被带进坑里。
你用 AI 查你不了解的领域,你就没有判断答案对错的能力——你不知道 AI 在哪个地方出错了。这种不对称是 AI 使用中最容易被忽视的问题。
写在最后
用 AI 这件事,最终比的不是谁会用工具,比的是谁脑子清楚。
谁知道自己要什么、谁能判断 AI 给的东西好不好、谁能高效地修正 AI 的输出——这部分是人来做的,AI 做不了。
AI 是杠杆,能放大你的能力,但不能替代你的能力。用 AI 之前,先确认自己的方向是对的。
方向错了,杠杆越大,翻车越惨。
还有一个我没来得及展开的点:AI 会让人变懒。不是操作变懒,是思考变懒。你用搜索引擎,你还在自己判断哪个链接更有用。用 AI 你连判断都省了,直接拿结论走人。这个习惯维持三个月,你的独立判断能力会明显退化。不是危言耸听,我自己就有过——有一段时间重度依赖 AI 写代码,后来发现自己写正则的时候脑子已经不转了。