LFM2.5-350M · WEBGPU
LLM inference on hand-written WGSL kernels only — no ONNX, no transformers.js.
~390 tok/s single chat · ~1640 tok/s batched · GPTQ int4 · Chrome/Edge 125+
LFM2.5-350M by default, ?model=2 for LFM2
LLM inference on hand-written WGSL kernels only — no ONNX, no transformers.js.
~390 tok/s single chat · ~1640 tok/s batched · GPTQ int4 · Chrome/Edge 125+
LFM2.5-350M by default, ?model=2 for LFM2