Three LFM2.5-2.6B in parallel on an iGPU
Ollama queued every request in a single slot because lfm2 is blocklisted from parallelism. llama-server fixed it.
Read Article →
Ollama queued every request in a single slot because lfm2 is blocklisted from parallelism. llama-server fixed it.
Read Article →