AI深度学习论文入门:从这5篇经典读起不迷路

AI深度学习论文入门:从这5篇经典读起不迷路
ai深度学习论文入门:从AlexNet到BERT的5篇经典阅读顺序

简单说:读ai深度学习论文别贪多,按AlexNet、VGG、ResNet、Transformer、BERT的时间线啃5篇就够。每篇只求画得出结构图、讲得清动机,笔记用三栏法。三个月读完,比囤30篇的清单靠谱多了。

两年前的三月,我给自己立了个目标:啃ai深度学习论文,从2012年的老论文一路读到2018年。当时胃口不小,一口气列了30篇的清单。两周后,清单躺在抽屉里,我一篇都没读完。

问题不在懒。在顺序。

后来我把清单砍到5篇,按时间线重排,花了差不多三个月全部读完。这5篇是AlexNet、VGG、ResNet、Attention Is All You Need、BERT。这篇就是那三个月的阅读复盘,包括每篇读了多久、哪里卡住、卡住了怎么解决、笔记长什么样,都是能直接抄作业的细节。

新手读ai深度学习论文,为什么十有八九会卡住

卡住大多不是智商问题,是起点选错了。新手从最新的热门论文读起,等于不会走就去跨百米栏;从2012年的经典读起,反而一路顺。

我第一次弃坑就是这么来的。那会儿听人说Transformer重要,我直接下载了Attention Is All You Need,第一页看到多头注意力的公式,第二页开始头疼,第三页合上电脑。前后40分钟。

挺打击人的。

后来一位读研的朋友点了我一句:这个领域的论文是有剧情的,每一篇都在解决上一篇留下的坑,你从最新一篇读起,等于从电视剧最后一集开始看,人物关系当然懵。这句话把我救了。

所以我的排法就一条:按时间,从老到新。想看机器学习那边怎么排,可以参考我之前整理的机器学习论文入门阅读顺序,思路完全一致。

5篇ai深度学习论文的顺序,我踩完坑后的排法

顺序是AlexNet、VGG、ResNet、Transformer、BERT,按年代排,每篇恰好解决上一篇的遗留问题。全部啃完约三个月,每天一小时足够。

这条线背后的逻辑不复杂。AlexNet证明深度网络在图像上真的行,VGG证明小卷积核往深堆更好使,ResNet治好网络深了反而变笨的怪病,Transformer把这套本事搬到文字上,BERT再把Transformer喂到饱。一条线下来,没有断点。

五篇正文加起来不到100页。听着少。读起来一点不轻松。

第1篇:AlexNet,我的论文初体验

AlexNet(2012)是深度学习在图像领域的成名一战,论文摘要里写着top-5错误率15.3%,比第二名的26.2%直接碾压了十个百分点。新手从它读起,能最快建立"卷积网络在干什么"的画面感。

这篇我读了5个晚上,每晚约1小时。第1晚只干了一件事:把那张8层的网络结构图抄在方格本上,5层卷积加3层全连接,边抄边标每层的尺寸。抄完那晚我兴奋得没睡着,觉得自己摸到门了。

第3晚撞了墙。局部响应归一化那一节,公式看得我发懵,卡了半个多小时。我做了个决定:跳过。后来读到别的论文才知道,这个技术基本被弃用了,真庆幸当时没死磕。

老实讲,读完这篇我就记住了两样东西:15.3%对26.2%的那场碾压,还有用两块GPU训练了近6天。数字比公式管用,这是我读论文学到的第一课。

第2篇:VGG,两个研究生写出的教科书

VGG(2014)的思路一句话讲完:全部用3x3的小卷积核,往深处堆,堆到16层和19层。它是5篇里最薄、最好读的一篇,适合当读完AlexNet后的甜点。

我只花了2个晚上。第1晚通读,第2晚把论文里A到E五个网络配置的表格抄下来对比。没有卡壳的地方,全程顺滑。

有一点要提醒。读它之前,最好先把深度学习到底是什么这类概念科普过一遍,不然"感受野"这个词能让你停下来查半天,我就在第2页停了20分钟。

我个人觉得VGG被低估了。它没什么花活,但把"堆深度"这条路走到了当时的极限,还顺手把ResNet要解决的问题暴露了出来。当过渡读物,完美。

第3篇:ResNet,我读得最苦也最值的一篇

ResNet(2015)用"残差连接"解决了网络越深效果越差的怪事,堆到152层,还拿下当年ImageNet竞赛第一,top-5错误率3.57%,论文里和5.1%的人类水平摆在一起比。它难读,读通之后的成就感也最大。

这篇前后耗了我3周,5篇里最久。卡点在第1节那个残差学习公式,编号(1),我对着它坐了4个晚上,愣是没看透。第5天我换了招:放下公式,先看图1。那张图讲的是件反直觉的事,56层网络的训练误差反而比20层的高。看懂这张图再回头读公式,居然一下就通了。

这是我读论文方法的一次升级:读不懂,先看图和实验,别跟公式硬刚。

3.57%这个数字我记到现在。论文原文在arXiv上免费看,编号1512.03385。

说个插曲。读ResNet那阵子,我迷上了打印论文,A4双面,一篇十几页,往包里一塞,通勤地铁上读,拿笔随便画。

话说回来,我家那台老打印机也因此立了功——它三天两头卡纸,我修打印机的次数快赶上读论文的次数了。挺离谱的。

但纸上读论文这招我强烈推荐。屏幕上读,我总忍不住切出去摸鱼;纸上读,手里有笔,眼睛跑不掉。三个月5篇,我全是在纸上读完的。

第4篇:Attention Is All You Need,正文只有10页的硬骨头

这篇2017年的论文是Transformer的出处,如今各种大模型的共同祖先,Google Scholar上的引用早就破了十万次。它正文只有10页,却是5篇里最硬的,我啃了2周多。

多头注意力那一节,我来回读了4遍。第1遍完全没懂,第2遍懂了一半,第4遍才敢说入门。我的笨办法:把那张架构图打印出来贴在桌前,照着图把一句话从输入到输出的完整流向走一遍。走一遍不够,就走三遍。

一个冷知识。这篇的8位作者贡献相当,署名顺序是抽签随机定的,脚注里写得明明白白。不夸张地说,这是我在论文里见过最诚实的一句话。

读它的具体打法,跟我之前总结的论文三遍阅读法完全对得上:第一遍跳过全部公式只看图,第二遍只攻多头注意力,第三遍合上论文自己画架构图。我第三遍画得缺了俩模块,又回炉补了一晚。原文在arXiv的1706.03762。

第5篇:BERT,最适合练复述的一篇

BERT(2018)把Transformer拿来用海量文本做预训练,最大版本3.4亿参数,一口气刷新11项语言任务的成绩。它结构上没什么新东西,正好拿来检验你前4篇学没学扎实。

我读了半个月,一半时间花在预训练那一节。里面藏着我全部阅读里最喜欢的一个细节:随机挑15%的词做掩码,其中80%换成[MASK],10%换成随机词,10%原地不动。这个80/10/10的设计,第一遍读很容易滑过去,琢磨透之后你会对"训练是门手艺"有新的敬意。

读完我给自己安排了场考试:约了个同事,给他讲了20分钟BERT。他听懂了七八成,而我在这20分钟里暴露了三个讲不清的点,回炉又读了一晚。复述这一招,比闷头读三遍都管用。真的。

原文同样在arXiv上免费,编号1810.04805。

论文笔记怎么做才不白读

我的答案是三栏笔记加复述测试:左栏抄原文关键句,中栏写自己的白话翻译,右栏记疑问和后来的解法。读完3天再做一次白纸复述,过了才算完。

我的笔记长这样:方格本摊开,左栏英文原句照抄,比如ResNet里讲残差动机的那句;中栏写我自己的翻译,翻不出人话就说明没懂;右栏记卡壳点,格式是"公式(1)不懂,看图1解决,第5天"。一篇论文6到8页,BERT那篇写了11页。

试过iPad配笔记App,一个月后放弃了。手写慢,但慢就是筛子,逼你只记要紧的。App里我光挑模板就挑了俩小时。不划算。

这套格式也不是我凭空发明的,是从几篇讲精读方法的文章里拼出来的,这份论文精读流程和笔记模板里有更完整的版本,可以直接对照着用。

5篇读下来,我的体感对比

难度最低的是VGG,性价比最高的是AlexNet,最磨人的是Transformer。难度和收获不总成正比,BERT就是花力气不算多、体感收获却排前列的一篇。

论文年份我花的时长难度体感一句点评
AlexNet20125个晚上3星必读的第一篇,气势最足
VGG20142个晚上2星甜点,顺手就过
ResNet20153周4星最苦,但方法论的转折点
Attention Is All You Need20172周多5星硬骨头,躲不掉
BERT2018半个月3星半练复述的最佳素材

表里的时长都是纯阅读时间,不含查资料和记笔记。全算上,得翻一倍。

要是只允许读一篇,我选ResNet。它教我的不只是残差,还有"读不懂就换角度"这件事,这招后来我用在了每一篇论文上。

常见问题

读ai深度学习论文之前,要先补数学吗?

不用补全再开始。我的线性代数是大一学的,早忘光了,照样读完了这5篇。真正用到的数学很零碎,碰到了当场查就行,矩阵乘法和softmax半天就能捡回来。想先补三个月数学再读论文的人,多半三个月后连论文都没打开过。

英文不好,能读这些论文吗?

能,但要接受读得慢这个事实。我的英语四级飘过,一页要查七八个词。笨办法是分两遍:第一遍只看图和表格,第二遍再啃正文,专有名词查一次记一次。5篇下来常见术语就那几十个,越读越快。

每篇论文都要读到能推公式吗?

不用,我一篇都没推全过。我给自己定的及格线就三条:能不看资料画出核心图,能用自己的话讲清动机,记住一两个关键数字。到这个程度,跟人聊就不露怯了。做研究可能要求更细,入门真不必。

这5篇读完之后,接着读什么?

两条路。继续走图像,读DenseNet和EfficientNet;跟大模型这条线,去读GPT系列。我的建议是中间插一篇综述压压阵,把知识串起来。更远的规划可以看看这份深度学习自学通关路线,我下一步就是照它定的。

回头看这三个月,读ai深度学习论文给我最大的改变不是记住了多少公式,是我不再怕新论文了。碰到没读过的,我知道先看图、找动机、记数字,卡住了也明白这是正常流程。这份胆子,比知识本身值钱。

觉得这篇有用的话,转给那个正对着论文发懵的朋友吧,他可能就差一个正确的起点。