Axi's Blog
致新生的你/后日谈:极简新生手册

前言#

在绝大多数时候,对于任何泛计算机领域中的新人,笔者都建议读者完整阅读一次 致新生的你。这篇博客包含了关于如何学习以及科研的完整方法论与详细步骤,可以使读者对于在大学、甚至以后参与围绕科研的学习过程,有更加全面的了解。

与此同时,《致新生的你》是一篇过长的博客。尽管每一个段落笔者都不舍得删除,但是读者在阅读的过程中,难免注意力逐渐不集中,从而忽略一些关键部分。

因此写作本篇博客的意义似乎也就明了了,我们要摒弃掉致新生的你之中自底向上的讲述模式(即先告诉读者要做什么,并且把为什么这样做的原因在过程中缓慢透露),而是自顶向下,从最本质的目的出发,一环环拆解,并且保留那些最为核心的内容。

学习的必要性#

阅读《致新生的你》系列的博客,本质上是在追求内卷。由此,本文先阐述学习或者说“内卷”的必要性。

实习是大厂就业的门槛#

排除读者可能确实对某些人工智能技术感兴趣——那自然学习以及科研是理所应当的事情,不必赘述——大多数读者升学念书、不断学习,最终追求的是学历以及毕业后的薪资水平。而其中对于学历的追求,也多半是因为其对于薪资的影响。如果本科毕业就可以获得超过博士的薪资,那么谁又愿意在学校中继续蹉跎岁月呢?

因此,我们可以将薪资作为接下来取得一切“进度”的衡量标准

在当下,计算机专业受到人工智能的冲击,传统码农面临一些失业风险,这或许是一些读者在网络上看到的情况。这里无意对学历进行歧视,不过一个既定的事实是:计算机专业曾经不论学历都可以获得不错的薪资,而如今只是退化到了一种更依赖学历的状态。

那些学历或职业发展较为不顺利的群体受到的冲击更为明显;而大多数 985,甚至所谓中九以及华五,显然依然处于计算机专业的红利区或者缓冲区。我们得以继续正常地讨论就业。

对于互联网企业来说,招收正常的开发或者算法工程师,本质上是需要一位入职就可以充分履行职能的员工,而非需要培养的白纸。因此,即使是在校招过程中,企业往往也要求应聘者具有实习经历;对于大多数希望前往大厂就业的读者来说,这些经历显然又以大厂实习最佳。

结论一:大厂需要实习经历,实习经历越出彩越好。

论文投稿需要时间#

出彩的实习经历需要时间积累。毕竟,不可能指望一位只有一个暑假实习时间的实习生飞速进入某个业务团队、甚至算法科研团队的核心圈层,并承担和完成重要职责。

在当前绝大多数相关岗位需要研究生及以上学历背景的情况下,这往往意味着读者需要在读研或者读博期间争取外出实习。

对于老师来说,让学生出去实习,尤其是普通的开发或者算法实习,而非偏向科研探索,完全是赔本买卖。老师需要学生完成自己申请的项目,并且为自己产出科研成果。

然而,一些老师还是会允许学生外出实习,前提是例如要求学生发表一篇论文,并将外出实习的机会作为某种激励。这是绝大多数允许实习的课题组所采用的模式。

结论二:在课题组中,往往采用论文发表作为外出实习的前提条件。

论文发表往往需要时间。一方面,这涉及读者编程水平以及科研水平的缓慢提升;另一方面,当下人工智能领域投稿论文量激增,导致审稿人压力增大,进而扩充审稿人数量,使审稿人的平均质量同时下降。大量领域中的新手,只是因为一两篇论文中稿就可以被邀请为审稿人,使得审稿结果和论文质量的相关性下降。

绝对出彩的论文依然具有很大的中稿概率;但如果读者的论文质量处于投稿论文的前 45%,而非前 5%,那么中稿往往就需要运气。如果被拒稿,则需要转投其他会议。

由于不能一稿多投,同时审稿周期客观存在,一篇论文如果追求中稿,往往可能经历多轮 rolling:在一个不大的概率中反复抽奖,或者说进行多轮采样,来追求更大的中稿期望。如果读者没有能力同时推进多个科研项目,那么就需要时间等待。

结论三:一般质量的论文中稿依赖 rolling,也就是需要时间积累。

越早开始科研,留给实习的时间越多#

纵观研究生的两年半时间,其中课内上课占据一年。如果读者没有科研基础,那么打下基础并且逐渐上手课题,可能还需要半年左右;之后的 rolling 即使运气不错,两轮大概也是半年到八个月,留给实习的时间自然不多。

我们由此得到一个推论:科研开始得越早越好。 这往往需要读者提前具有科研基础,并得以在研一时就推进科研课题;更深厚的科研能力积累,甚至可以产出高质量论文,从而更轻松地满足实习要求。

对于保研的同学来说,即使在保研过程中不接触科研,依然可以从大四开始心无旁骛地上手科研,从而早日产出论文;更有可能的是,在此之前就已经擅长科研许久。这也是为什么从统计学意义上,在计算机领域,考研学生毕业后的发展往往不如保研学生:这不仅关于天赋,也关于时间这一客观问题。

科研成果影响岗位与薪资上限#

对于开发以及算法相关的基础岗位遵循实习的逻辑,因此从时间上需要趁早科研,来获得不错的薪资,构成了争取薪资下限的底层逻辑。而另一方面,如果读者想要争取毕业后薪资的上限,一条普适的方向依然是通过科研。

一般认为,现在高收入的技术相关计算机岗位,主要包括量化交易以及人工智能相关岗位。前者需要读者具有算法竞赛基础,并且在大学期间获得金牌等奖项,从而获得机会,在此不再赘述;而后者本质上依然依赖读者在人工智能领域的科研成果,以及在大厂中进行科研实习、产出技术报告或参与大型模型训练的经历——而它们的入场门票依然是科研成果。

作为参考,对于中等 985 及以上的学生来说:

岗位方向常见背景或条件或许的参考年包
开发岗硕士学位,具有正常的开发相关实习250k–400k
算法岗与具体业务和工作内容强相关400k–700k
科研岗(硕士)热门且与大厂匹配的方向;产出尚可时与算法岗接近产出较好时约 700k–1M,少数特例更高
科研岗(博士)热门且与大厂匹配的方向;具有较好产出或大型项目经历通常约 1M,产出较好时可超过 1M

科研的入门#

上文阐述了保研以及科研的必要性,在这里我们简要阐述保研的组成部分,并且描述科研的入门流程。

保研资格与目标院校录取#

对于课题组来说,上述大厂招收应届生的逻辑依然成立。一名老师招收自己的研究生或者博士生,往往希望得到科研经验丰富、能力在线的学生,而非一张白纸。老师对于学生能力的衡量标准往往也是科研水平,因为这正是学生入学之后主要需要从事的事情。

对于学生科研水平的证明,一条显然的逻辑是:已有的科研成果 > 有效的科研经历 > 可能的科研潜能。 对应到简历内容,即论文发表、有效科研经历,以及体现学习能力的绩点。不过现实中,往往不存在非常有效的科研经历却完全没有论文发表,因此在没有产出的情况下,绩点的证明力可能大于一段普通的科研经历。

保研由两部分组成:

  • 本校发放保研资格:往往依据本校规定,由前三年的考试成绩以及课外拓展排名决定,并且以考试成绩为主。这是读者需要自行考虑的内容;完整的《致新生的你》中给出了一些可以参考的学习方法。
  • 目标院校愿意接收:对于本校往往较为简单;对于外校,则通常通过名为夏令营或预推免的集体考核活动完成。考核由笔试、机试与面试中的几项组成。能否入围往往依赖简历水平,包括院校、排名、科研及竞赛成果;之后可能还有硬性考核与老师面试,最后进行加权排名。

值得注意的是,不同于高考本质上在为学校选择学生,研究生和博士生的选拔本质上是在为某一个特定的老师选择学生。这在一定程度上需要学生的能力与性格符合老师的需求。

类型谁的话语权更大主要特点
强 com招生委员会(committee)更依赖统一的纸面与硬性考核,单次发挥影响更大
弱 com目标老师更看重长期科研能力、合作匹配度与老师的接收意愿

对于不少学校,尤其是博士生选拔,往往只包含面试,或者老师的话语权极大,可以忽略其他硬性考核环节,我们称之为弱 com;反之,老师话语权较弱则为强 com。大多数较好院校的博士和部分硕士往往是弱 com,而不少看似强 com 的项目,在个人水平达标之后也具有弱 com 的属性。

大多数时候,我们应该避开强 com 这种依赖单次发挥决定结果的考核,转向要求科研能力、需要长期积累且容错更大的弱 com 考核。

因此,本文建议读者先进行科研,并且在一段时间之后前往目标院校、目标老师的课题组进行科研实习,与老师打下合作基础,从而获得考核过程中老师的 offer。这就是常见的弱 com 流程。同时,科研带来的论文产出会极大增强读者的简历,也对将来的实习有重大帮助。

进组前需要掌握的科研基础#

详细的科研学习路线见《致新生的你》完整文章,其中包含更具体的学习建议。极简版本如下:

  1. 补齐数学基础。

    学习高数、线代以及概率论,掌握后续理解模型与论文所需的最小数学知识。

  2. 建立计算机基础。

    学习 Linux 的使用以及 Python 编程,能够独立配置环境并运行项目。

  3. 进入人工智能。

    学习 CS231n,并在过程中补充 PyTorch 等人工智能相关的编程知识。

  4. 掌握编程智能体。

    学会使用 Codex 或 Claude Code 等 Coding Agent,加速环境搭建、代码阅读、实现与调试。

  5. 选择领域并阅读论文。

    了解当前的科研领域划分,找到自己喜欢的方向,再阅读该领域的经典论文。

  6. 申请第一段科研实习。

    带着已经形成的基础进入课题组,开始真正的科研实践。

笔者强烈建议读者先具有科研基础,再申请进组实习,而不是先进组实习再打基础,尽管现在很多老师确实允许实习生零基础进组。一方面,自学且尚未进组的紧迫感可以提高读者的学习效率;另一方面,老师的课题组一定包含某些方向偏好。如果第一段实习的方向并不理想,老师推荐的科研基础学习内容可能并非主流所需,反而对打基础产生事倍功半的效果。

同样,笔者也强烈建议读者直接申请某一领域非常著名的课题组或热门目标领域,而不是先在水平一般的课题组或冷门领域中进行一段科研作为跳板

在人工智能领域中,事实上往往并不存在所谓的触类旁通。一些不热门的领域往往相对落后,而先进技术通常在不同领域同等适用。这使得热门领域往往具备更好的职业发展前景;冷门领域积累的也未必是独到见解,而可能只是比较落后的技术,或者仅适用于该领域的经验。因此,直接前往目标领域以及更好的课题组,往往才是理想起点。

申请课题组并不会花钱,也没有那么花时间,往往只是需要一些勇气。即使被拒绝,老师通常也不会因此对你留下坏印象;多申请、多寻找机会才是正道。

Coding Agent 提升了科研并行度#

另一个值得注意的事情,是科研过程中的并行度。伴随 Coding Agent 的兴起,大多数人的编程水平被拉近,甚至一些 auto research 程序都可以产出可发表的科研成果短文。在科研中争取更多论文发表,往往需要同时追求质量以及数量。

事实上,早在两年前,如果读者充分利用当时的 Coding Agent(或者说代码补全)工具,就已经可以拉满计算资源。个人的代码能力应该始终处于过剩状态。

相较于 Agent 带来的效率提升,事实上无论国内还是国外,学界算力的增幅都没有那么大。笔者一开始在人机所实习时,用的是四卡 2080Ti,并在 AutoDL 租了一张 4090;再往后去更大的平台,可以调度几百张 4090,甚至几百张 A/H 卡,并且始终可以确保可调度算力的利用率在 90% 以上。

如果 autoresearch 可以水出两篇论文,那么面对竞争,科研初学者显然有三种方案:

  1. 扩大规模:花费更多时间争取资源并管理调度,让 autoresearch 产出五六篇论文。
  2. 提高质量:花费更多时间思考,在 autoresearch 的结果上进一步做出更好的论文。
  3. 转向更难替代的方向:前往无法 autoresearch,或者资源开销更大、对研究者理论与直觉要求更高的领域。

我们无法忽略,一篇科研成果由三个要素组成:时间、效率以及资源。 在没有时光机或者芯片制程突破的当下,效率提升只是迫使我们放弃以工作量评判进度的视角;时间和资源的投入依然不能减少。

方法型论文的科研循环#

对于普通方法类型的论文,一个常见的科研循环如下:

  1. 了解竞争情况。

    进入一个新兴领域,首先弄清当前问题、主流路线以及 SOTA 工作。

  2. 复现当前 SOTA。

    跑通训练和评测,确保模型之外的数据、测试等环节都正确无误。

  3. 建立成熟的训练场。

    将复现结果沉淀为可靠的 playground,用来验证自己的 idea。

  4. 持续改进方法。

    使用 Coding Agent 或自己的想法修改方法、运行实验并记录结果。

  5. 并行搭建下一条路线。

    在模型训练或者 Coding Agent 修改代码的同时,前去构造一个新的训练场。

薪资的上限#

在阐述了为什么科研以及如何科研之后,我们接下来讨论:在确保基础毕业要求以及实习能力之后,如何追求科研岗位与研究员在企业或者实验室中的薪资最大化——即究竟是什么内容构成了工资。

企业为什么不只看论文#

一个赤裸的事实是,除了在学校中,绝大多数论文发表并不意味着任何事情。纵观大模型的发展历程,真正对模型产生深远影响的论文往往寥寥无几;它们要么产出自那些 frontier lab,要么可能是多年以前的论文。

伴随着闭源模型战争愈演愈烈,技术被封锁在实验室内部。这里的“闭源”不只限于模型权重,也包括预训练大模型的完整流程、数据管线以及 infra 等。这些才是除了权重之外,实验室真正的核心资产,决定了它能否再次产出类似水平、甚至更好的模型权重。

而那些真正带领模型能力前进的部分,如 infra、RL 与数据,更是不依赖学界产出而存在。它们需要更多练习机会、更多试错成本以及更多资源消耗;与之相对,那些在学术论文中被验证有效的方法,在更大规模的训练中往往会被证明不具有决定性影响。

那么,既然 paper doesn’t matter,究竟什么重要?让我们通过一个例子简单阐述。假设你是一家初创 AI 公司,打算开展大模型预训练业务,面对三位应聘者:

  • 科研皇帝:THU 本科以及直博,在学生生涯一直在清华的实验室从事 LLM 相关科研,发表顶会一作三十篇。
  • 预训练练习生:华五直博,在某 frontier lab 的预训练组进行实习,实习期间但是作为贡献者参与到了几篇大型的模型技术报告,但是确实在其中也不是非常核心。
  • 数据清洗大师:华五直博,在某 frontier lab 的预训练组进行数据清洗,产出了非常优质的数据,经过多轮的消融以及合版检验。

对于并非非常成熟的业务、甚至已经比较成熟的业务来说,后二者的竞争力都可能在一定程度上大于前者,大致排名甚至可能是 2 > 3 > 1

在预训练等更依赖系统工程推进的领域中,往往只需要寥寥几个可以给出灵光一现 idea 的大脑;剩下那些同样手握百万年薪的人,凭借的则是自己积累的工程能力。

如何在千卡、万卡上训练大尺寸模型,如何筛选高质量数据,如何提高模型推理速度——尤其是这些经验已经在前司的大规模服务器上,以一种近乎网格搜索的方式找到了答案——如今这些经验带来的,就是真金白银的节约。

大规模实践经验如何转化为身价#

试想一下,某个数据或者训练流程的坑,在前司花费千卡迭代了一个月才得到答案,这显然就是一条价值千万的经验。对于公司来说,花费一两百万年薪招聘一个人,吸收这些经验,同时还可以得到这个人一年的劳动力,以及他带领公司走得更远的可能性,这显然是一个稳赚不赔的买卖。

那么,如何在进入就业市场之前烧掉足够的资源,积累足够的技术水平以及经验?答案再次昭然若揭:实习。

对于直博以及读研但进度较快的读者,如果想追求更高的上限,显然需要尽快积累科研水平,并在更早的时候进入大厂的后训练、甚至预训练组进行科研实习。

值得一提的是,遗憾的是现在大厂的预训练岗位越发紧张。毕竟资源有限、大厂有限,Coding Agent 又越来越强,对于实习生的硬性能力门槛事实上正在软化;那么 connection 确实也不可避免地成为其中需要品味的一环。

结语#

行文至此,再次进入尾声。《致新生的你》给出了更加详细的学习心法以及学习路线,本文则尝试从中抓出最主要的需求与核心路径。

从功利的视角衡量,当我们追求更高薪资时,综合期望上的两个关键里程碑依然难以绕开:先科研,再实习。

接触更多资源,积累更多经验,提升自己的水平与身价,并且沿着这条路疾驰——这便是我们经过本文推论而来的一条第一性原理道路。

致新生的你/后日谈:极简新生手册
https://axi404.github.io/blog/advise-epilogue-3
Author阿汐
Published atAugust 5, 2026
Comment seems to stuck. Try to refresh?✨