第1104章 你说的这些,叫做大模型 (第2/2页)
能互相复用。”
“做的都是大规模神经网络、大型深度网络、无监督预训练网络,准确的来说是先用大量无标注数据学通用特征,再拿少量标注数据适配具体任务,BengiO、HintOn 都做过相关研究。”
“我就在想,那么可不可以做一套巨型神经网络底座,在海量无标注公开数据上做无监督预训练,学习通用世界知识,之后不需要完整重训,简单适配,就可以处理语言、对话、图像推理等大量不同任务。”
“它可以拥有巨大参数量、海量训练语料、足够强悍的并行算力,或者说我们这个模型不是为某一个单一功能写死,而是先学常识,再去解决任务。”
“最后实现能自然对话、逻辑推理,接近人的认知。”
说完以后,成文飞观察着陈星的表情,结果发现这位新老板脸上充满了惊讶,于是赶紧补充道,“陈总,我知道现在不可能直接实现成品,这也只是我的一个想法,但我们可以提前把所有底层基础设施全部搭建完成。”
“这是我们长远目标,目标。”
“现在可以为这个目标做好地基。”
陈星此时此刻内心处在狂喜之中,成文飞不愧是成文飞。
他说的是大规模神经网络,大型深度网络。
这些词在未来有一个更加准确的称呼。
叫做大模型!
2013年啊,成教授就已经有大模型的概念,通用模型的模糊概念了!
“不不不,成教授,你说的也是我想说的,我的设想就是构建一个规模足够大的神经网络,先用海量无标注数据预训练,学习世界的通用表征,之后不需要全部重训,只做少量调整,就可以处理语言、对话、甚至图像等多种任务。它不是 AGI 完整的通用人工智能,但它是通向 AGI 的一块核心基石。”
“为了拥有这块基石,我才邀请成教授你到红星来的。”
“而你说的这些,可以称之为大模型。”
成文飞此时也产生了一种异样的感觉。
陈总好懂啊。
陈总好懂我啊。
这套理论他之前在宾夕法尼亚的时候也和业内人士说过,只不过他们都说自己异想天开。
还大型深度学习网络,现在的CPU算力集群怎么可能处理得了海量数据。
更别提训练了。
所以那时候成文飞就知道,CPU算力集群,一定会被淘汰掉,效率太低太低了。
想实现真正的模型训练,必须要有效率更高的方式,霉国那边目前大家都在尝试用图形计算卡来实现,只不过还没有厂商有成果和论文在学术界出现。
不过成文飞觉得,用分布式的GPU进行训练,绝对是未来的方向,所以半个月前听到甘良才说红星在自研GPU和计算卡的时候,就明白一件事。
红星的在一些方向上,是确定的,是开始行动的,是走在霉国很多机构和公司前面的。
“那么陈总,要实现你所谓的大模型,我口中的大型深度网络,就必须要有足够的算力,现在的CPU计算到了一定瓶颈,大家准备转向GPU并行计算,那我想问一下,这方面咱们红星是怎么打算的?”
陈星不语,走到自己办公桌前,并示意成文飞也过来。
然后拿出了无冬大师给自己的那份报告。
“成教授,你先看看这个。”