现有的 Transformer 的架构仍然是基于大力出奇迹的模式。文章中被访者“Transformer 八子”之一卢卡斯提到 人类其实不需要这么多的参数,就能得出更精妙的结论。这种独特的运行模式始终没有被学到。也就是卢卡斯所说的 "人类的学习与研究方式,或许能带给机器学习深刻的启示。"在大模型之前,也有想通过各种规则的方式来实现,后来被证明不行。但现在又开始了通过强化学习来训练。但他也提到 "可验证的边界是非常模糊且富有弹性的。", 我认为这里面是有两种原因。第一是数据还不够。因为人体整体自身是一个多维的、长时间的、持续的一个复杂的学习体, 所获得的数据量是远超当前的所谓的输入的上下文。第二种就是前面所说的人脑的学习方式还没有被正确的揭示开来。
评论