返回

第429章 全部失败

首页
关灯
护眼
字:
大
中
小
上一章 回目录 下一页 进书架
最新网址:wap.80ge.info
    美利坚,加利福尼亚州,山景城。

    谷歌deepmind总部的一间实验室里。

    杰里米安德森是deepmind前沿评估团队的技术主管,他在这行做了快十年了。

    从alphafold到gemini,他见证过太多大模型从无到有的过程。

    可眼前这个东西,让他第一次感到棘手。

    未央。

    燕大那个只做数学的模型。

    如果只看它现在的样子,不过是一个垂直领域的专用工具,连聊天都不会。

    但安德森却很清楚,如果未央能在数学上彻底消灭幻觉问题,那它背後的架构和范式一旦推广到通用领域……

    到那个时候,华夏在大模型这条赛道上就不是追赶的问题了,而是换了一条完全不同的跑道,而一但华夏的赛道上没有了障碍,那懂得人都懂……

    所以他接到的任务很简单:摸清楚未央的底。

    他第一步就是嚐试知识蒸馏。

    构造了一批精心设计的数学问题输入未央的公测接口,收集它的输出,然後用这些输入输出对去训练一个小模型,试图让小模型模仿未央的推理行为,从而反推它的内部表征结构。

    这是行内的常规手段,对绝大多数公开部署的模型都有效。

    结果却让他大吃一惊,失败了。

    小模型训出来了,但它学到的东西完全是一堆无意义的格式化噪声。

    蒸馏後的模型在任何一道测试题上都输出乱码,连最基本的算术都做不对。

    後面他又嚐试了成员推断攻击。

    通过向未央反复输入已知文献中的定理和证明片段,观察它的响应置信度变化,以此判断这些文献是否出现在它的训练数据中。

    结果还是失败。

    未央的响应模式完全不符合任何已知的基於统计拟合的模型特征。

    它不像是在“回忆”训练数据,而更像是在现场推导,每一次给出的证明路径都不完全相同,但逻辑上都严格成立。

    最後他使用了最见不得光的对抗性探针注入。

    安德森的团队构造了一组专门用来触发模型内部表征泄露的提示序列,这些序列包含了精心设计的逻辑陷阱和自引用结构

    (本章未完,请点击下一页继续阅读)
最新网址:wap.80ge.info
上一章 回目录 下一页 存书签