第402章 路就在眼前,你们修不修吧。(3/6)

不过他问的,全是绕着降维算法原始论文打转的东西,loss面的收敛半径、泛化误差上界、离散网格的采样密度。

没一句是干货。

李东听了几分钟,大概就明白这到底是怎么回事了。

这三家,平日里你抢我的人我挖你的墙角。

谁家的预训练在哪儿卡了壳,那都是压箱底的机密,当着两家死对头的面,谁会真的掏底呀?

按照这个聊法,聊到大会闭幕,也聊不进正题。

于是李东放下茶杯,笑眯眯地打断了雅各布。

“雅各布博士,你问的这些,你们组自己挂出来的技术报告里,就有答案。”

“咱们立个规矩吧。”李东笑着看向了休息室里的众人,“今天在这间屋子里,不管谁提的问题,我的回答,三家一起听。”

“所以……藏着掖着的最吃亏。”

三位首席科学家面面相觑。

几秒钟后,也不知道是谁先把心一横。

反正答案大家都听得见,那还客气什么?

多问的,才是赚的。

“李东教授。”

还是雅各布先开口。

“那我换个问法。”

“千亿级参数的loss曲面,强上全量hessian矩阵纯属做梦,二阶的预条件子连显存都塞不进,只能退化到一阶的adam系硬磨。”

“如果先用您那套算法重排,把参数空间正交化到近似对角阵……”

“预条件子,是不是就能直接降维成逐元素的标量缩放?”

他一说完,另外两家的人也停下了手中正在记录的笔,抬头看向李东。

李东听完点了点头。

“路子是对的。”

“但你们光盯着算力和显存了,问题的核心不在于算不算得起。”

“而在于你们根本不知道,该在哪个标度上去算。”

雅各布一怔:“标度?”

“loss曲率不是一张静态的地图。”

李东说道。

“它跟着你的batch size缩,跟着学习率漂,还跟着网络的width一起扭曲。”

“我那个算法之所以成立,是因为zeta算子的谱特征背后,有一套解析的scalingw兜底。”
本章未完,请翻下一页继续阅读.........

附近章节