Do you support speculative decoding?

Last updated: August 6, 2026

Yes. On Dedicated Endpoints you can enable it at creation (Speculative decoding → Draft model / N-gram Spec decoding : On); on Model API we apply latency optimizations including speculative decoding, though availability varies by model.

See our speculative decoding docs or Draft-model speculative decoding blog for more detail.