AI Resonance · 阅读最新日报 · AI 入门推荐

2026-10-02 · America/Los_Angeles · 社区动态 · #19

CUDA: fuse shared experts into MMVQ by am17an · Pull Request #29184 · ggml-org/llama.cpp

MoE speedup, but only for some MoE architectures (like Qwen 35B A3B)

CUDA: fuse shared experts into MMVQ by am17an · Pull Request #29184 · ggml-org/llama.cpp

热度 44.2 / 100;排名与评分保留该期记录。