章闻铎没什麽反应,这本来就是基准,连差一点的模型都能过的题,不算什麽。
从第十一组开始,是探针的核心序列。
他设计了一套「状态追踪「题组:同一个场景,以十七种不同的表述方式喂给模型。
措辞不同,信息顺序不同,中间插入大量干扰句,为的就是破坏语义的注意力机制。
如果模型只是在做语义匹配,换了表面形式之後答案就会飘移。
想要保证答案的一致性,需要模型在它内部维护一个「世界状态」,这样无论表面怎麽变化,逻辑答案都应该保持一致。
当然,现在的大语言模型都不会去「维护」这个状态,但是章闻铎想要探索的方向是:
如果模型在训练过程中形成了稳定的因果结构表徵,它就可以表现得「像」是有一个内部状态一样,输出得答案就应该保持一致。
之前他在国外的顶级模型上进行过小范围验证,答案如他预料的一样,没有模型能够表现出这种能力来。
然而汤圆不一样。
终端里,汤圆的答案一条条输出,现在已经进行到了第十五组验证。
前面几组验证数据的特徵值已经远超章闻铎验证过的国外顶尖模型。
而第十五组的最後一个变体,在插入了七条干扰句,汤圆依然输出了正确答案,并且在它的思考过程中还提示了更多的信息:「需要注意的是,尽管文中多次提及初始状态,但根据第三段的描述,该状态在後续已发生变化,正确答案应基於最终状态而非初始状态。」
探针还在继续运行。
但是章闻铎的心思已经不在屏幕上了。
基於现在看到的这冰山一角的结果,他已经预感到了。
汤圆作为一个纯语义训练的模型,理解世界状态的能力大幅高於他测试过的其他模型。
这说明了什麽?
章闻铎抬头看了看窗外,时间已经从清晨到了上午,而他完全没有察觉。
京城的天空今天是一片澄澈的蓝色,没有一丝云。
那条他以为走不通的岔路,其实走得通。
高质量的原始数据和语义标注对世界模型的方向也是有意义的。
章闻铎的心里说不好是开心还是痛苦。
他不再关注还在运行的探针脚本,起身去接了一杯水。
妈蛋,论文要重新写了一结论还是一百八十度的大掉头!