2026-10-02 · America/Los_Angeles · 社区动态 · #19
CUDA: fuse shared experts into MMVQ by am17an · Pull Request #29184 · ggml-org/llama.cpp
MoE speedup, but only for some MoE architectures (like Qwen 35B A3B)
热度 44.2 / 100;排名与评分保留该期记录。
2026-10-02 · America/Los_Angeles · 社区动态 · #19
MoE speedup, but only for some MoE architectures (like Qwen 35B A3B)
热度 44.2 / 100;排名与评分保留该期记录。