AngelSpec Documentation

AngelSpec Documentation#

AngelSpec is a torch-native framework for training speculative-decoding draft models, covering both autoregressive MTP drafting and the block-parallel DFlash family. Inference and training are disaggregated: inference engines generate target-model hidden states and stream them — via the Mooncake store over RDMA — to distributed training workers, so each side scales independently.

AngelSpec supports 6 draft architectures (Eagle3, DFlash, DFlare, DFly, DSpark, MTP) across multiple inference backends (vLLM, SGLang, HuggingFace).

Examples