trunk/f8d084d5b5ddddc114e3118c077e98d626a304a9: flex_gemm: support block-scaled GEMMs through QUACK (#192839)
- PyTorch 近 90 天出现 1016 次
- PyTorch 近 90 天第 1005 次发版
- 上一次:同一天稍早 · ciflow/trunk/197050: [UPDATE] Update
发生了什么
Human Note With this we can finally do full lowp mlp (dense) in SiLU -> FP8, without a BF16 intermediate rounding. return quantize_mxfp8(F.silu(acc.float())) def mlp(x, sx, w1, sw1, w2, sw2, *, tuned=True): options = {"backend": "QUACK", "tuned": tuned} hidden, sh = flex_gemm( F.scaled_mm, (x, w1.t(), sx, sw1), silu_and_quantize, gemm_kwargs=SCALED_MM, kernel_options=options, ) return flex_gemm( F.scaled_mm, (hidden…
摘要按规则整理自下方来源原文