第429章 全部失败 (第1/2页)
美利坚,加利福尼亚州,山景城。
谷歌deepmind总部的一间实验室里。
杰里米安德森是deepmind前沿评估团队的技术主管,他在这行做了快十年了。
从alphafold到gemini,他见证过太多大模型从无到有的过程。
可眼前这个东西,让他第一次感到棘手。
未央。
燕大那个只做数学的模型。
如果只看它现在的样子,不过是一个垂直领域的专用工具,连聊天都不会。
但安德森却很清楚,如果未央能在数学上彻底消灭幻觉问题,那它背後的架构和范式一旦推广到通用领域……
到那个时候,华夏在大模型这条赛道上就不是追赶的问题了,而是换了一条完全不同的跑道,而一但华夏的赛道上没有了障碍,那懂得人都懂……
所以他接到的任务很简单:摸清楚未央的底。
他第一步就是嚐试知识蒸馏。
构造了一批精心设计的数学问题输入未央的公测接口,收集它的输出,然後用这些输入输出对去训练一个小模型,试图让小模型模仿未央的推理行为,从而反推它的内部表征结构。
这是行内的常规手段,对绝大多数公开部署的模型都有效。
结果却让他大吃一惊,失败了。
小模型训出来了,但它学到的东西完全是一堆无意义的格式化噪声。
蒸馏後的模型在任何一道测试题上都输出乱码,连最基本的算术都做不对。
後面他又嚐试了成员推断攻击。
通过向未央反复输入已知文献中的定理和证明片段,观察它的响应置信度变化,以此判断这些文献是否出现在它的训练数据中。
结果还是失败。
未央的响应模式完全不符合任何已知的基於统计拟合的模型特征。
它不像是在“回忆”训练数据,而更像是在现场推导,每一次给出的证明路径都不完全相同,但逻辑上都严格成立。
最後他使用了最见不得光的对抗性探针注入。
安德森的团队构造了一组专门用来触发模型内部表征泄露的提示序列,这些序列包含了精心设计的逻辑陷阱和自引用结构,在其他大模型上曾成功提取出隐藏的系统提示甚至权重分布的统计指纹。
他本来还满怀信心,结果未央直接返回了一行标准化的错误提示。
“输入格式不符合数学命题规范,请重新输入。”
当时安德森人都傻了,这特麽是什麽大模型??是不是有点不讲道理了?
他脸色难看的坐在屏幕前。
他在这行干了快十年,见过各种各样的大模型——有做得好的,有做得差的,有吹牛吹上天结果一紮就破的,也有确实硬核但多试几次总能找到缝隙的。
哪怕是华夏之前那些模型,不管对外宣传得多麽天花乱坠,他们去蒸馏的时候也没遇到过任何阻碍。
该拿的东西照拿,该摸的底照摸。
可这个未央,从头到尾什麽都摸不到。
它甚至不像是一个基於统计学习的模型——它的行为模式和他见过的所有大模型都不一样。
他沉默了很久,拿起手机拨了个号。
电话接通了。
“朗,失败了。”
……
燕大,李东
(本章未完,请点击下一页继续阅读)