大模型的训练,可以想象成“教一个超级聪明的孩子读书写字”。
第一步,是“海量阅读”。我们给模型喂进互联网上的几乎所有文字——书籍、文章、网页、对话等等。它不需要人一句句讲解,而是自己看大量句子,反复练习一个游戏:遮住一个词,猜这个词应该是什么。猜错了就调整,猜对了就巩固。经过无数次这样的“猜词游戏”,它慢慢学会了词语之间怎么搭配,句子怎么组织,甚至掌握了常识和逻辑。这就像孩子读了一万本书,虽然没有老师教,但自己摸清了语言的规律。
第二步,是“专项辅导”。读完书之后,模型已经会说话,但有时会跑偏,或者不懂礼貌。这时我们再用一些“标准答案”来教它。比如我们给它提问:“猫为什么会掉毛?”然后人工写一个正确、温和的回答。模型学习模仿这些答案,就像老师拿着好作文让学生背诵、仿写。这一阶段让模型回答问题更准确、更符合人类习惯。
第三步,是“实战考核”。我们会让模型回答很多问题,并请人类打分:答得好不好,有没有错误,是否冒犯用户。根据打分,模型会调整自己的“脑回路”,让以后更倾向于选择得分高的答案。这个过程叫“人类反馈强化学习”,就像学生每次考试后,根据老师的评语改正错误,越考越好。
整个训练过程需要巨大的计算资源和数据,就像把一个小孩子从幼儿园培养到大学毕业,但它的“学习教材”是整个互联网。最终,这个模型就变成了我们平时聊天的智能助手。 |
|