AI的学习和你以为的不一样:机器学习入门白话版

AI的学习和你以为的不一样:机器学习入门白话版
用刷题比喻讲AI的学习与机器学习入门原理

简单说:AI的学习不是往脑子里灌知识,而是从一堆例题里自己总结套路。模型就是那本"套路笔记",训练就是刷题,过拟合就是只会死记题号不会做新题。想入门机器学习,先把这个过程想通,再看代码。

AI的学习这四个字,我第一次认真琢磨是在四年前,当时看了一堆教程,越看越糊涂。什么损失函数、梯度下降,名词一个接一个砸过来,我笔记记了三十多页,合上本子还是讲不清一台机器到底怎么"学会"认猫。卡了小半年,转机出现在一个特别不体面的场景:我在给侄女讲她错了一半的数学卷子,讲到第三题突然愣住——她错的题全是做过原题的变式,原题她会,改个数字就懵。

那一刻我悟了。

机器学习跟这个一模一样:训练是刷题,模型是总结出来的套路,过拟合就是死记硬背题号。整件事的底层逻辑,用学习这件事一比就通。下面我把当年卡过我的概念挨个翻译成人话,你要是也被名词劝退过,这篇应该能帮你省下那半年。

先说清楚:AI的学习到底在学什么?

原子答案:AI的学习学的不是知识本身,是一套从例子里找规律的"猜题技巧"。给它看一万张猫的照片,它总结出判断猫的套路,而不是记住这一万只猫。这跟我们背课文完全是两条路子。

当年我最大的误解,是以为有人给电脑写了一堆"猫有尖耳朵、有胡须"的规则,电脑照着查。真不是。没人写规则。人只干两件事:准备一堆带正确答案的例题(这张是猫、这张不是),然后按一下"开始学"。剩下的规律提取,机器自己完成。

举个例子最快。垃圾分类:你给模型看五万条"邮件内容→是否垃圾邮件"的记录,它自己琢磨出"含'中奖'俩字的基本是垃圾"这类判断倾向。没人教它这条规则,它是刷完这五万道题自己总结的。挺离谱的。

想看更正式的定义,可以去翻 Wikipedia 的机器学习词条,里头有严谨版表述。我就是先看懂白话版,再回头看它,才真正读进去。

训练=刷题:题海是怎么把机器喂会的

原子答案:训练就是把带答案的例题一遍遍喂给模型,答错了就调整内部的判断参数,像刷题对答案改错本。题刷得够多,套路就浮出来了。没有玄学,全靠重复纠错。

讲个我自己搭模型的经历,细节都在。去年三月我第一次跑手写数字识别,训练集六万张图。头一轮跑完,模型十张里认对七张。这就是刚刷完一轮题的学生水平,错三张正常。关键在后面:每认错一张,程序会算出"错得多离谱",再顺着这个错误把内部几百万个参数每个都拧一点点。这个"算错得多离谱"的东西叫损失函数,"拧参数"的动作叫梯度下降。名字唬人,事情就这么点事。

我跑了十轮。第三轮正确率爬到九成,第八轮稳在 96% 上下,第十轮 96.5%,基本不动了。像不像你刷数学卷子,前五套进步飞快,刷到第二十套就死活提不动了?机器一模一样。当时的判断依据很实在:正确率连续三轮涨幅小于 0.3%,就停,别浪费显卡时间。

有人问那 AI 是不是要一直喂新题。不用无限喂,但题的质量比数量金贵。这个话题我在AI智能怎么学习新知识那篇里专门拆过。

模型=套路:刷完题留下的那本"笔记"

原子答案:模型不是数据库,是刷完几百万道题之后沉淀下来的一本套路笔记。你问它新问题,它翻套路来猜,而不是翻原题抄答案。这个定位搞错了,后面全歪。

我第一次想通这件事,靠的是我高中那本物理错题本。那本子前半截是抄题,后半截全是"见到斜面先分解重力"这种套路句。抄题的部分毕业就废了,套路部分现在还能用。模型就是后半截,纯套路,零原题。

所以"大模型"大在哪?大在这本套路笔记的页数。几十亿参数,几十亿条细微的判断倾向,全是刷题刷出来的。它没有题库,自然也就没法精确"背"出训练数据里出现过的某句话——只能按套路现编一个高概率的回答。这就是为什么它有时一本正经地胡说八道:套路推出来的答案,不代表题库里有原题。

这套机制对孩子学习的启发其实很大,不是买台机器那么简单,我在AI时代的学习法里聊过死记硬背还能不能打。

过拟合=死记硬背:我卡了最久的一个概念

原子答案:过拟合就是模型把训练题全背下来了,训练正确率 99%,一到新题就掉到 70%。等于死记题号的学生上了考场,换张卷子就露馅。这是机器学习入门第一坑,我栽得很结实。

老实讲,这个概念卡了我整整两个月。当时我用自己攒的二百张美食照片训个分类器,训练数据上表现完美,十张全对,我兴奋地发到群里。当时就飘了。有朋友随手甩来十张新图,五张认错。同一个模型,两副面孔。

后来用一个比喻想通了。我侄女背乘法表只会顺着背,你问"三七"她答"二十一",飞快;你问"七三",她卡住,要从"一七得七"重新背起。她背的是顺序,不是乘法规律。我的分类器干的就是这事:二百张图它全记脸了,没提炼出"烤串的特征是签子和焦色"这种可迁移的东西。训练题上它是神,新题上它是惨案现场。

治这个病也有白话版:多给题(加数据)、逼它只抓大套路别抠细节(正则化)、提前停笔别让它背得太熟(早停法)。我用的是加数据那招,照片扩到两千张,新图正确率从 50% 回到 85%。两周,纯手工标注,眼睛都快瞎了。

顺带一句,专业解释可以看 Wikipedia 的 Overfitting 词条,数学描述比我这版严密,但意思就是上面这个意思。

话说回来,我后来发现这套比喻不光帮我自己入门,还救过一次团建。公司有个非技术的同事要在分享会上讲"我们产品里的推荐算法",PPT 里全是公式,头一晚找我哭。我让她把"召回"讲成"先海选出五百个候选",把"排序"讲成"再从五百个里挑十个你最可能点的",配上相亲的比方。第二天全场没一个人玩手机。技术这东西,讲不清,多半是讲的人自己也没真懂。

这件事之后我信了一个理:能翻译成生活比喻的概念才是真学会了。背下来的名词,风一吹就散。

AI的学习和你以为的差在哪:一张表对齐

原子答案:多数人以为 AI 的学习是"被写入知识",实际是"自己刷题总结套路"。以为它记得住原题,实际它只带走了套路。以为多喂题就一定更好,实际题不干净反而学坏。差距主要在这三处。

你以为的实际发生的我的吐槽
工程师给 AI 写规则工程师只给例题和答案,规则自己长出来写规则那叫传统编程,费人;这个费显卡
AI 记住了所有训练数据只留下套路,原题基本丢了所以它会瞎编,别指望它背原文
数据越多效果一定越好脏数据越多学得越歪喂错题比不喂还可怕,亲测
训练一次就一劳永逸世界变了就得重训或微调跟人一样,不更新知识就落伍

补一句表里放不下的:2023 年斯坦福大学等机构研究者联合发表的论文《How Is ChatGPT's Behavior Changing Over Time?》系统评估了 GPT-4 在多项任务上的表现,发现同一模型随版本更迭在部分任务上明显变弱——新版未必处处更强。机器学出来的东西不是恒定真理,会随训练和版本漂移。所以别迷信某个版本一劳永逸。

零基础怎么开始机器学习入门:我的三步顺序

原子答案:先跑通一个现成的小项目找手感,再补数学只补够用的那点,最后才碰原理推导。顺序反了就是当年那个笔记三十页还讲不清的我。亲测这个顺序最快。

第一步,找一个不用写代码也能玩的练习场。我个人觉得 Google 的 Machine Learning Crash Course 是免费里最好的:中文有支持、练习嵌在网页里、概念配可视化,第一周就能跑完。我侄女高二,我用它当教材给她讲过周末班,六小时下来她能把"训练集和测试集为啥要分开"讲回给我听。

第二步,把"过拟合"和"训练/测试集"这两个概念焊死在脑子里。它们是所有后续内容的地基,地基不稳,后面神经网络一层套一层直接给你干晕。

第三步才碰数学。说实话,入门阶段会用导数和均值就够了,线性代数等真需要再回头补。别被劝退贴里"先啃三个月数学"的说法吓住,那是给搞研究的人排的路。先动手后补课,想反过来走的人,我在学习AI前先想清楚这5件事里见过太多,基本都停在第一章。

深度学习又是啥:套路摞套路

原子答案:深度学习是机器学习的一个分支,区别在于套路分了很多层,浅层抓边角线条,深层抓组合特征,层层摞起来就能认出一张脸。不是新学科,是摞层数的玩法。

还是打比方。识别一张猫脸:第一层学"这有条竖线""这是个圆弧",第二层把竖线圆弧拼成"耳朵的形状",第三层拼成"猫头",最后一层拍板"是猫"。我管它叫包工头分包:大工头不搬砖,只管把活一层层派下去,每层只干一小件。当年"神经网络"这个词吓退我的原因,是名字起得太像大脑,其实跟大脑关系不大,纯粹是历史起名没起好。

想知道这行转岗难不难,可以看看我朋友那份前端程序员转岗机器学习的记录,时间线和坑都在里面。

常见问题

AI的学习需要先会编程吗?

想理解原理,不需要,用 Google 那个 Crash Course 加这篇的白话比喻就能懂个八九成。想动手做点东西,Python 得会一点,但真只是一点:入门项目用到的语法,一个周末学得完。别拿编程当门槛挡自己。

训练一个模型要多少数据?

看任务。玩具级的分类,几百张图能跑通;能用的实用级,几千到几万条起步;大语言模型那种,按万亿 token 算。我的经验是数据质量比数量重要十倍:两千张标对的图,好过两万张标得随手的。

为什么 AI 会一本正经地编造事实?

因为它输出的是"套路推出来的高概率答案",不是"从题库抄来的原文"。套路在没见过的题目上就会推出一本正经的错误答案,跟死记硬背的学生蒙选择题一个样。这不是 bug,是这套学习方式的天然性格。

普通人学机器学习有什么用?

两用处。一是不再被"AI 全自动智能学习"这类营销话术唬住,知道机器是怎么学的,销售的话术在你这儿自动打折。二是真上手做出一两个小工具后,跟技术同事吵架都有底气。至于学习路线怎么排,我整理过一份按目标定制的三条路线图,对号入座就行。

写在最后:把"刷题"这个比喻带走

AI的学习,说穿了就是一台不知疲倦的刷题机器:刷题长套路,套路换新题,背题必翻车。这十九个字我建议你原样带走,比十个名词都值钱。

回头看,我卡壳那半年最大的损失不是时间,是自信——一直以为是自己笨,其实是没人用人话讲。所以这篇从头到尾没给你堆公式,就干一件事:把机器学习入门的几个核心概念翻译成你早就懂的学习经验。你要也有被某个名词卡住的经历,欢迎留言讲讲,说不定下一篇就写它。

觉得有用的话,转给那个正被教程劝退的朋友,说不定能救他半年。