jevland

replica source-backed

jev-on-a-laptop: parallel constrained decoding on MLX

Prefill once, broadcast the KV cache per field, evaluate all fields in one pass on Qwen 1.5B–8B models; a Hugging Face Space demo exists.

7.9x versus token-by-token decoding, 50–85% accuracy on 24 labelled cases depending on model size. Independent.

source-backed — Public repository, docs or live artifact. About this label

← Back to the directory