首页 > 学习技巧 > 干货知识 > 高文院士谈AI:规模即所需,三“大”缺一不可

高文院士谈AI:规模即所需,三“大”缺一不可

发布时间:2024-05-26 15:40:17来源: 152102

规模是做好生成式人工智能的撒手锏,大数据、大模型和大算力对于生成式人工智能缺一不可。”在近日举行的第七届数字中国峰会之中国移动人工智能生态大会上,中国工程院院士、鹏城实验室主任、北京大学博雅讲习教授高文表示。高文院士回顾了人工智能发展的三次浪潮,并对影响当下生成式人工智能发展的关键因素进行了分析。

历经三次浪潮

1956年夏天,美国达特茅斯学院举行了一场研讨会,在会上麦卡锡首提“人工智能”,标志着人工智能元年的到来。追忆历史,高文表示,从1956年开始人工智能经历了三次浪潮:以推理研究为主的第一次浪潮,持续20年左右时间;以专家系统为主的第二次浪潮,持续30年左右时间;以及从2006年开始的第三次浪潮。其中第三次浪潮又包括两大技术进展:从2009年开始的判别式人工智能,从2018年开始的生成式人工智能。

2009年,华裔科学家李飞飞和李凯教授提出imageNet(图像网络),一石激起千层浪,业界八仙过海各显神通,纷纷基于imageNet提出各自的判别式人工智能算法,直到2012年深度神经元网络出现,以绝对优势令其他算法黯然失色,将百花齐放的格局进行收敛。2015年微软研究院何凯明、孙剑等联合提出ResNet(残差网络),又将判别式人工智能带到了新高度。此后,从深度神经网络DNN到卷积神经网络CNN再到循环神经网络RNN,深度网络快速迭代,不断走向新的技术高度。

“判别式人工智能以模式识别见长,如图像分类、人脸识别、智能监测等,如今广泛应用的人脸识别正是判别式人工智能的应用。判别式人工智能与人的对象认知学习接近,可以根据学习速度、记忆规模、判别准确度判断其结果好坏。”高文分析。

大语言模型破解长语言序列难题

不过,判别式人工智能通过在神经网络中输入大量数据进行快速判别,擅长图像和矩阵识别,对于长语言序列则力不从心。在这样的形势下,大语言模型应运而生,致力于解决长语言序列问题,而生成式人工智能则是大语言模型的最主要突破。

高文表示,自2018年开始生成式人工智能快速迭代,从大语言模型LLM到ChatGPT再到Sora多模态,万变不离其宗的是底层关键技术GPT(生成式预训练模型)。GPT引入注意力机制,使得一个长串中无论相隔多远的两个相关数据都能连接在一起,并训练出关联度。“GPT的核心算法是用大量序列做大模型预训练,关键是注意力机制。由于GPT算法对业界并无差别,因此具体应用效果取决于学习速度、记忆规模、表达准确度等。”高文认为。

虽然如今ChatGPT如火如荼,但是GPT起初并没有激起太多涟漪。这是因为GPT使用起来问题较多:给出的答案要么过于简单,要么过于复杂,要么不合规,存在意识形态、文化习惯、行业差别等方面的问题。

ChatGPT的出现改变了这一现象,使得业界对于人工智能的印象和投入力度大为改观。不过从底层技术看,从GPT到ChatGPT并没有改变,其不同在于:一是ChatGPT增加了InstructionGPT指令,通过微调、对齐和抑制,使得回答更加“人模人样”;二是引入基于人类反馈的增强学习RLHF,解决合规问题和垂应用适配等。

大数据、大模型和大算力缺一不可

在中国移动人工智能生态大会上,中国移动发布了“万千百”智能基座,其中,“万”指“万”卡互联并行加速算力供给,中国移动年内将投产3个近两万卡超大规模单体智算中心和12个区域智算中心,广泛升级1500个边缘节点,为全社会提供澎湃算力。

中国移动在智算中心方面的规模投入并非个例,随着生成式人工智能的发展,全国各地多个智算中心如雨后春笋不断出现,而这背后的原因是人工智能的发展需要算力支撑。

“生成式人工智能做得好不好,规模是决性定因素。”高文一语道出其中关键。

高文表示,GPT和Sora等人工智能生成技术并没有提出理论革新,与20年前的人工智能神经网络理论本质上并无差异。生成式人工智能的突破得益于大数据、大模型和大算力,这三个“大”缺一不可。特别是算力,如今千卡是入门级规模,要想做大模型必须有万卡级。

对于规模,OpenAI等公司也有深刻见解:如果能用规模解决问题,就无需动用新的算法。不仅如此,OpenAI还提出了“假设性三公理”,已被AI领域奉为圭臬。

第一条公理,苦涩的教训。多年来人工智能的研究者们一直试着将人类已知的知识构建到他们的智能体中,但是屡战屡败。成功的极少数案例都是使用规模计算,通过搜索和机器学习完成的。大规模、大算力和大数据是通用人工智能的必要条件。

第二条公理,规模即所需。一旦选择了良好且通用的数据标注、算法,就能够找到一套通用的规律,数据越多,模型越大,效果就越好,而且这个规律在训练之前就可以预知效果。大规模是通用人工智能AGI的充分条件,大就是好。

第三条公理,涌现需规模。随着规模的扩大、数据的增加,大模型一定会涌现出前所未有的能力,这个能力可以被所有人看到。

最后,高文总结表示,判别式人工智能方兴未艾,生成式人工智能如火如荼,关于下一波浪潮业界也有很多预测,如无人驾驶、具身智能、人形机器等,但总体而言仍不得而知。未来充满想象,值得我们期待,也需要业界有所作为。高文特别提到,中国的人工智能需要自己的大模型底座,只有这样才能实现以中文语料和中国历史为基础的文明传承。

干货知识更多>>

冬季触发:《BF博发文化集团》是騙局吗?被骗不允许你还不知道,真相令人无法相信! 约会平台!“华腾数据APP”受骗亏损无法出金!曝光真相原来如此!,情况可疑! 绝不可信:《华立科技》网约被骗不能出金让人大跌眼镜的真实故事节奏! 还能找回吗!《易迅APP》真相令人惊掉下巴!被骗不能出金! 还不悔悟:《亿邦动力APP》被骗后无法提现!做三个任务操作错误有猫腻! 派发数据单!《益智APP》被骗都是自己贪,真相令人无法相信! 万万没想到:《巨领科技APP》警惕被骗陷阱别入局,无法出金圈套让人捉摸不透!! 大爆料揭晓:《潜云APP》不正规!被骗亏损真相揭秘!亲身亏损经历!! 血本无归:《聚米乐科技》不能提现不正规是不可信不靠谱的! 欲火焚身:《星核致远》被骗无法出金?白日做梦终不长,骗子骗人没商量!! 对接数据!《BFCloud》不可信不合法不正规不靠谱连环被骗的局! 头条实事:《快风APP》被骗不能提款提现真相揭秘不要上当!! 是骗的局:《华亿集团》不靠谱不可信!网约受骗不能提现真相!! 心有不甘:《兴晟传媒》骗子有理莫相信,操作失误让你掏钱洞无底线! 瞒天过海:《YESBETApp》被骗不让提现套路太深!究竟看懂了没!钱都没了!! 数据不匹配!“PFIOL软件”受骗无法出金!无法提现不要继续,骗你操作! 吓人:《韵美文化传媒》是真的吗?操作错误不停的投入会怎么样!! 瞒天过海:《安浩科技》平台软件不靠谱!失误修补各种理由投入多少都是送!! 啥情况怎么了:《帕琪科技APP》数据修复不能提现!巨额亏损真相令人胆寒心惊!! 活跃度不足!《suvioAPP》被骗信用分不足无法出金 操作会失误:《聚米乐科技》做三单数据纯属骗,不要惊慌以免继续沉沦里面!! 大爆料揭晓:《皇城传媒》骗子有理莫相信,轮番角色切勿上当受骗!! 头条实事:《前海数据网约平台》软件做三个任务被骗,操作错误信誉不足都是借口!! 还能找回吗?《夜都APP》平台不靠谱不可信!不是真的不合法!! 1分钟诠释:《亿邦动力》警惕被骗陷阱别入局,不能提现全是套路! 灯牌升级!“Guangy”受骗了!不正规不可信!真是郁闷!,非常无语! 文化传媒:《国晨科技》做三单数据纯属骗,不要惊慌以免继续沉沦里面!! 被骗后续:《帕琪科技APP》被骗不能提款提现真相揭秘不要上当!! 是真的吗?《缦元文化传媒》被骗不可信不靠谱 背后真相令人震惊 还不悔悟:《华亿集团》不可信!积分无法提现就是套路陷阱,不正规不靠谱不是真的!