Do you support speculative decoding?
Last updated: August 6, 2026
Yes. On Dedicated Endpoints you can enable it at creation (Speculative decoding → Draft model / N-gram Spec decoding : On); on Model API we apply latency optimizations including speculative decoding, though availability varies by model.
See our speculative decoding docs or Draft-model speculative decoding blog for more detail.