← 返回事件
持续讨论AI发版

trunk/f8d084d5b5ddddc114e3118c077e98d626a304a9: flex_gemm: support block-scaled GEMMs through QUACK (#192839)

发生了什么

Human Note With this we can finally do full lowp mlp (dense) in SiLU -> FP8, without a BF16 intermediate rounding. return quantize_mxfp8(F.silu(acc.float())) def mlp(x, sx, w1, sw1, w2, sw2, *, tuned=True): options = {"backend": "QUACK", "tuned": tuned} hidden, sh = flex_gemm( F.scaled_mm, (x, w1.t(), sx, sw1), silu_and_quantize, gemm_kwargs=SCALED_MM, kernel_options=options, ) return flex_gemm( F.scaled_mm, (hidden…

摘要按规则整理自下方来源原文

为什么在扩散

来源