设置

关灯

第255章 美**惑

    此章节稍后订阅由于断网可能会赶不上全勤所以复制了一些乱七八糟的东西明天之前就会改正
    thep1atform评论称,tpu并不复杂,更像是雷达应用的信号处理引擎,而不是标准的x86衍生架构。,虽然tpu有很多矩阵乘法单元,但tpu比“gpu在思路上更接近浮点单元协处理器”,tpu没有任何存储程序,仅执行从主机送的指令。
    由于要获取大量的权重并将这些权重送到矩阵乘法单元,tpu上的dram是作为一个独立的单元并行运行。同时,矩阵乘法单元通过减少统一缓冲区的读写降低能耗,也就是进行所谓的“脉动运行”(systo1)。
    tpu有两个内存,还有一个用于存储模型中参数的外部dram。参数进来以后,从矩阵乘法单元的上层开始加载。同时,可以从左边加载激活,也就是“神经元”的输出。这些都以“systo1ic”脉动的方式进入矩阵单元,然后进行矩阵相乘,每个周期可以做64,ooo次累积。
    鉴于大多数使用机器学习的公司(除了facebook)都使用cpu做推理,因此谷歌tpu论文将英特尔“hae11”xeopu做了对比,而且从数据可以后者在多维度推理方面
 <本章未完请点击"下一页"继续观看!>