What it does
A C/C++ LLM inference runtime spanning GGUF, quantization, CPU/GPU backends, CLI, and an OpenAI-compatible server.
128,542C++
License: MITRepository last updated: Sep 17, 2026
View details OSS TAGS
llama.cpp related
Popular starting points
Newest
What it does
A C/C++ LLM inference runtime spanning GGUF, quantization, CPU/GPU backends, CLI, and an OpenAI-compatible server.