手指又微微张开,数据块相应变大,传送带上也变得更密集,整个流水线的运转效率再次提升。
很快,传送带开始承受压力,眼看着就要崩溃了。
这时候,韩路一的手指停了下来。
这就是最佳大小了。
在意念世界中,韩路一手掌一挥,这个最佳参数也被写进了电脑上的代码里。
易如反掌。
在虚拟投影的世界里,韩路一漂浮在半空中,俯视着经过调整之後正在高速有序的运转的机械工厂,心里涌出一种快感。
这种快感,就像是把俄罗斯方块堆的高高的,只留出边上的一个空列,来了一个长条一落到底,一下消除四行。
那样一种快感。
这是一种专属於工程师的快感。
韩路一再次打开视界,检查一下这个算子适配的实现情况。
【当前算子:FusedAttentionBackward】
【优化策略:块内重计算+数据块(Tile)大小校准】
【单步耗时:46.8ms→4.6ms】
【显存读写量:理论最优值的1.09倍】
【利用率:31%→91%】
【状态:已适配√】
韩路一看了一眼这组数字,脸上露出一点笑容。
单步耗时缩短到原来的十分之一,利用率从三成拉到九成以上,显存读写也逼近了理论极限。
他轻轻地吐出一口气。
这才是L100应该有的样子。
做完了这个最难的算子的适配,韩路一对新研发出来的这个视界技能【算子适配】有了一个大概的了解。
网上所有能找到的硬体、编译、调优知识,视界全都吸收进去了,最後做出来的这个视界技能,更是把工程验证的过程直接变成了意念里的沙盒游戏。
至於效率嘛————大概是一个大型工程师团队的几千倍以上。
竟然如此强大。
视哥,不差。
韩路一正准备一鼓作气接着做下一个算子的工作,只需要退出现在加载的【注意力融合反向算子】模块,然後再载入突然,他眼前充满科幻色彩的半透明界面和虚拟的硬体模型闪烁了两下,消失了。
韩路一错愕地眨了眨眼,意识到,是精力用尽了。
自从视界升级到四级,精力上限提升到一千之後,他已经不怎麽需要省着用视界了,可以说是想开就开,有的时候忘了关就一直开。
这还是他第一次把精力用尽。
韩路一默默回想了一下,开始做适配前的精力值是多少来着?
六百多?
他低头看了一下时间,还不到六点。
也就是说,不到一个小时的时间,他已经把可能要耗费大型工程团队几个月时间的工作做完了,同时消耗掉了六百多点精力。
这麽看来,今晚是没办法继续肝了,但是在视界如此给力的情况下,只要规划好精力的分配,一个月之内把所有的算子适配都做完是完全可行的。
韩路一满意地点了点头,手动在电脑上敲上了提交命令。
git add .&& git commit —m 「FusedAttentionBackward adapter completed「&& git
push
回车。
下班。
在韩路一下楼离开办公室的同时,十三楼的人工智慧基础设施组,有不少人还在加班o
江松然今天开组会的时候已经把接下来的计划传达过了,全力做L100的推理适配。
全组的人压力都很大。
给国产卡做算子适配,这在全国、乃至全世界都是最前沿的工作啊。
这种工作,是最不敢保证交付时间的,都是没人做过的东西,你根本没办法预测会在什麽地方出个填不平的大坑。
但是江松然说话的语气很笃定,虽然没有说明确的时间线,但是大家都感觉到了江松然的决心。
任务分配到人,每个人负责几个算子,按照优先级从高到低做,只要求功能实现,先不做性能调优,做完了就提交评审,然後再做下一个。
工作量很大,所以有不少人都自愿留下来加班。
范小天是其中一个。
源智基础设施团队的高级工程师,薪水拿的不低,但他不是为了钱来的。
他不一样,他是为了理想。
毕竟,如果一个人靠着英伟达的股票已经实现了财务自由的话,他接下来的工作不去追求理想,又去追求什麽呢?
当然,范小天一般不会把这句话说出来。
因为听起来太欠揍了。
但他确实是组里最资深、最有话语权的人之一。
原因很简单,他以前在英伟达做的就是类似的工作一给大模型训练框架里的内核(Kernal)做适配,做性能分析(Pro
(本章未完,请点击下一页继续阅读)