从 transformer 追溯到 CNN

为什么要写 transformer 的文章呢?大概归于 3 个原因 1)目前我对于大模型的理解仅停留在使用层面,API、提示词、Agent 玩的很 6,无法接触到很核心的东西。长期下去可能也没啥进步 2)网上对于 transformer 讲解的文章或者视频大多很晦涩难懂,没点神经网络的基础是真的很难看懂,希望这篇文章能够很透彻地剖析出来,能够让更多的人加入进来 3)带有很重的功利心,学习基础架构真的很枯燥,想通过写文章的方式鞭策自己。

什么人会读这篇文章?那些已经熟练使用大模型的开发者,包括 API、Function Call、format output 等等,他们非常想提升自己,不止于在 COT(思维链)、prompt、微调等方向上。所以如果你目前仅仅对大模型有简单的了解,或者仅仅会使用 kimi、文心一言、智谱清言等 app,那么你大概率是看不懂或者没必要看这篇文章的。阅读这篇文章时还需要你正襟危坐,需要保持很高的注意力,躺在床上或者站在地铁上玩手机基本也不可能读懂这篇文章,因为注意力是一个很稀缺的东西,transformer 正是凭借注意力才如此地出色。

transformer 是一个 seq2seq 模型,其实 seq2seq 的提出要早于 transformer(https://arxiv.org/pdf/1409.3215),早在 2014 年由 Google Brain 的三位专家提出,这三位分别是 Ilya Sutskever、Oriol Vinyal、Quoc V. Le,其中 Ilya 是首席科学家而其余两位是研究科学家。Ilya 是一位很传奇的人物,不仅是 Geoffrey Hinton(诺贝尔和图灵两项大奖的神人)在多伦多大学的学生,后面他也在 Google 参与了 transformer 的研究,并且在 2015 年加入 OpenAI 担任首席科学家,推动了大模型(如 GPT-3 和 GPT-4)的问世。只可惜在 2023 年参与了罢免 Sam Altman 的后宫戏中失败了,2024 年离开了 OpenAI,对外宣称是因为担心 OpenAI 平衡不了盈利和安全,言外之意为了钱什么事都能做出来,他的离开与这场宫斗戏是否有关不得而知,Ilya 离开后创立了一个新公司为 Safe Superintelligence Inc,聚焦于解决人工智能的安全性问题。

可以说,Ilya 最早参与研究的 seq2seq 为 transformer 奠定了非常重要的基础。什么是 seq2seq 模型呢?在 2014 年《Sequence to Sequence Learning with Neural Networks》论文中,把它定义为一个基于神经网络的序列到序列的学习模型,简单来说输入是一段话输出是另一段话的模型,简称为 seq2seq。为什么需要 seq2seq 呢?在 seq2seq 之前比较流行的是深度神经网络(Deep Neural Networks,简称 DNNs),DNNs 在语音转文字https://static.googleusercontent.com/media/research.google.com/zh-CN//pubs/archive/38131.pdf)和视觉识别上非常出色,但是却很难处理 seq2seq 任务。

所以我们了解到,transformer 是一个 seq2seq 模型,而早期的 seq2seq 模型只是对 DNNs 的一种改进方法,所以要搞明白这一切。谈到 DNNs,又离不开将它发扬光大 Geoffrey Hinton,这位大佬因为对 CNN 爆改为 AlexNet 框架(DNN 与 CNN 的关系是整体和部分的关系)获得很多奖项,Hinton 在《ImageNet Classification with Deep Convolutional Neural Networks》这篇论文中详细讲了爆改的细节,然而非常巧的是,在这篇论文中我们又看到了 Ilya 的身影,深度学习从 AlexNet 到 seq2seq,再到 transformer 都有 Ilya 的身影。

如果要搞明白这一切,就要从 CNN 开始讲起,我们可能要花费一整篇甚至 N 篇文章来讲解,希望有耐心的读者可以一起阅读完成。

  • 深度学习

    深度学习(Deep Learning)是机器学习的分支,是一种试图使用包含复杂结构或由多重非线性变换构成的多个处理层对数据进行高层抽象的算法。

    53 引用 • 40 回帖 • 2 关注

相关帖子

欢迎来到这里!

我们正在构建一个小众社区,大家在这里相互信任,以平等 • 自由 • 奔放的价值观进行分享交流。最终,希望大家能够找到与自己志同道合的伙伴,共同成长。

注册 关于
请输入回帖内容 ...

推荐标签 标签

  • JavaScript

    JavaScript 一种动态类型、弱类型、基于原型的直译式脚本语言,内置支持类型。它的解释器被称为 JavaScript 引擎,为浏览器的一部分,广泛用于客户端的脚本语言,最早是在 HTML 网页上使用,用来给 HTML 网页增加动态功能。

    729 引用 • 1327 回帖
  • CentOS

    CentOS(Community Enterprise Operating System)是 Linux 发行版之一,它是来自于 Red Hat Enterprise Linux 依照开放源代码规定释出的源代码所编译而成。由于出自同样的源代码,因此有些要求高度稳定的服务器以 CentOS 替代商业版的 Red Hat Enterprise Linux 使用。两者的不同在于 CentOS 并不包含封闭源代码软件。

    238 引用 • 224 回帖
  • ZooKeeper

    ZooKeeper 是一个分布式的,开放源码的分布式应用程序协调服务,是 Google 的 Chubby 一个开源的实现,是 Hadoop 和 HBase 的重要组件。它是一个为分布式应用提供一致性服务的软件,提供的功能包括:配置维护、域名服务、分布式同步、组服务等。

    59 引用 • 29 回帖 • 5 关注
  • 代码片段

    代码片段分为 CSS 与 JS 两种代码,添加在 [设置 - 外观 - 代码片段] 中,这些代码会在思源笔记加载时自动执行,用于改善笔记的样式或功能。

    用户在该标签下分享代码片段时需在帖子标题前添加 [css] [js] 用于区分代码片段类型。

    69 引用 • 372 回帖
  • 外包

    有空闲时间是接外包好呢还是学习好呢?

    26 引用 • 232 回帖 • 2 关注
  • 服务器

    服务器,也称伺服器,是提供计算服务的设备。由于服务器需要响应服务请求,并进行处理,因此一般来说服务器应具备承担服务并且保障服务的能力。

    125 引用 • 588 回帖
  • 支付宝

    支付宝是全球领先的独立第三方支付平台,致力于为广大用户提供安全快速的电子支付/网上支付/安全支付/手机支付体验,及转账收款/水电煤缴费/信用卡还款/AA 收款等生活服务应用。

    29 引用 • 347 回帖
  • Android

    Android 是一种以 Linux 为基础的开放源码操作系统,主要使用于便携设备。2005 年由 Google 收购注资,并拉拢多家制造商组成开放手机联盟开发改良,逐渐扩展到到平板电脑及其他领域上。

    334 引用 • 323 回帖 • 1 关注
  • Kotlin

    Kotlin 是一种在 Java 虚拟机上运行的静态类型编程语言,由 JetBrains 设计开发并开源。Kotlin 可以编译成 Java 字节码,也可以编译成 JavaScript,方便在没有 JVM 的设备上运行。在 Google I/O 2017 中,Google 宣布 Kotlin 成为 Android 官方开发语言。

    19 引用 • 33 回帖 • 63 关注
  • danl
    132 关注
  • VirtualBox

    VirtualBox 是一款开源虚拟机软件,最早由德国 Innotek 公司开发,由 Sun Microsystems 公司出品的软件,使用 Qt 编写,在 Sun 被 Oracle 收购后正式更名成 Oracle VM VirtualBox。

    10 引用 • 2 回帖 • 6 关注
  • WiFiDog

    WiFiDog 是一套开源的无线热点认证管理工具,主要功能包括:位置相关的内容递送;用户认证和授权;集中式网络监控。

    1 引用 • 7 回帖 • 587 关注
  • CSS

    CSS(Cascading Style Sheet)“层叠样式表”是用于控制网页样式并允许将样式信息与网页内容分离的一种标记性语言。

    198 引用 • 550 回帖
  • SOHO

    为成为自由职业者在家办公而努力吧!

    7 引用 • 55 回帖 • 19 关注
  • SSL

    SSL(Secure Sockets Layer 安全套接层),及其继任者传输层安全(Transport Layer Security,TLS)是为网络通信提供安全及数据完整性的一种安全协议。TLS 与 SSL 在传输层对网络连接进行加密。

    70 引用 • 193 回帖 • 431 关注
  • 安全

    安全永远都不是一个小问题。

    199 引用 • 816 回帖
  • CloudFoundry

    Cloud Foundry 是 VMware 推出的业界第一个开源 PaaS 云平台,它支持多种框架、语言、运行时环境、云平台及应用服务,使开发人员能够在几秒钟内进行应用程序的部署和扩展,无需担心任何基础架构的问题。

    5 引用 • 18 回帖 • 167 关注
  • Vue.js

    Vue.js(读音 /vju ː/,类似于 view)是一个构建数据驱动的 Web 界面库。Vue.js 的目标是通过尽可能简单的 API 实现响应的数据绑定和组合的视图组件。

    266 引用 • 665 回帖
  • 设计模式

    设计模式(Design pattern)代表了最佳的实践,通常被有经验的面向对象的软件开发人员所采用。设计模式是软件开发人员在软件开发过程中面临的一般问题的解决方案。这些解决方案是众多软件开发人员经过相当长的一段时间的试验和错误总结出来的。

    200 引用 • 120 回帖
  • 工具

    子曰:“工欲善其事,必先利其器。”

    286 引用 • 729 回帖
  • Windows

    Microsoft Windows 是美国微软公司研发的一套操作系统,它问世于 1985 年,起初仅仅是 Microsoft-DOS 模拟环境,后续的系统版本由于微软不断的更新升级,不但易用,也慢慢的成为家家户户人们最喜爱的操作系统。

    222 引用 • 473 回帖 • 1 关注
  • 导航

    各种网址链接、内容导航。

    40 引用 • 173 回帖
  • Jenkins

    Jenkins 是一套开源的持续集成工具。它提供了非常丰富的插件,让构建、部署、自动化集成项目变得简单易用。

    53 引用 • 37 回帖
  • V2Ray
    1 引用 • 15 回帖 • 1 关注
  • Laravel

    Laravel 是一套简洁、优雅的 PHP Web 开发框架。它采用 MVC 设计,是一款崇尚开发效率的全栈框架。

    20 引用 • 23 回帖 • 721 关注
  • 区块链

    区块链是分布式数据存储、点对点传输、共识机制、加密算法等计算机技术的新型应用模式。所谓共识机制是区块链系统中实现不同节点之间建立信任、获取权益的数学算法 。

    91 引用 • 751 回帖 • 2 关注
  • jQuery

    jQuery 是一套跨浏览器的 JavaScript 库,强化 HTML 与 JavaScript 之间的操作。由 John Resig 在 2006 年 1 月的 BarCamp NYC 上释出第一个版本。全球约有 28% 的网站使用 jQuery,是非常受欢迎的 JavaScript 库。

    63 引用 • 134 回帖 • 724 关注