Optimizing On-Device Inference for Apple Silicon
Perplexity's engineering team details Lily, a Rust-and-Metal local inference engine built specifically for Apple silicon and Qwen3.6-35B-A3B, which averages 1.23x MLX-LM's prefill and 1.35x its decode throughput on an M5 Max.
