OSS探訪

llama.cpp — GGUF・量子化・CPU/GPU backendを横断するC/C++ LLM推論runtime

OSS健全度 93
スコアの見方

発掘スコアはStars・Watchers・Forks・Contributorsを対数圧縮して重み付けした独自指標(上限なし)。成長モメンタムは観測期間内の同スコアの差、OSS健全度は取得できた更新状況・Community Health・Releaseの0〜100評価です。

Stars
128,542
主要言語
C++
ライセンス
MIT
リポジトリ最終更新
2026/09/17

概要

llama.cppは、GGUF modelをC/C++で軽量に推論するruntimeです。低bit量子化、CPU+GPU hybrid inference、CUDA・Metal・Vulkan・SYCL等のbackendを持ち、CLIだけでなくOpenAI-compatible API serverとbuilt-in Web UIも提供します。2026年9月17日時点のlatest releaseはv0.4.1です。

特徴と向いている用途

公式資料に基づく紹介・実機未検証 · 内容確認日:

CPUからNVIDIA・AMD・Apple Siliconまで幅広いhardwareでLLM/VLMを動かす

x86 AVX系、Apple SiliconのNEON/Accelerate/Metal、NVIDIA CUDA、AMD HIP、Vulkan、SYCL、OpenCLなど複数backendを持ち、VRAMを超えるmodel向けにCPU+GPU hybrid inferenceも利用できます。

出典:[2]

GGUFと低bit量子化でmemory・速度を調整し、CLI/APIの両方から使う

1.5〜8bitのinteger quantizationを扱い、model size・memory使用量・推論速度のtrade-offを調整できます。llama cliに加えてllama serveでOpenAI-compatible APIとWeb UIを起動できます。

出典:[2]

local AIをhardwareに合わせて細かく最適化したい開発者・組み込み用途に

desktop、server、edgeなどでLLM/VLM inferenceを軽量に組み込み、GPU backendやquantizationを自分で選択したい場合に向きます。

出典:[2]

modelとhardwareごとの差が大きく、version更新も速い

同じquantizationでもmodel architecture、context length、backend、memory bandwidthで性能が大きく変わるため、対象hardware上でbenchmarkしてください。v0.4.1では新model対応、JSON schema処理、server process管理、logging等が更新され、deprecated optionも整理されています。

出典:[3]

参考にした公式資料

  1. [1]ggml-org/llama.cpp — GitHub repository metadata(2026-09-17)
  2. [2]llama.cpp — README(2026-09-17)
  3. [3]llama.cpp v0.4.1 release(2026-09-17)
編集部からの補足

local AIの土台として、model format・quantization・hardware backendを細かく選べる点を重視しました。実機benchmark前提で評価してください。

3ステップで試す

  1. 1

    ソースを取得

    git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
  2. 2

    リポジトリへ移動

    cd llama.cpp
  3. 3

    公式手順を確認

    READMEのInstallation / Quick Start / Getting Startedにある公式コマンドを続けて実行してください。

    find . -maxdepth 1 -iname 'README*' -exec sed -n '1,220p' {} \; -quit
公式READMEで確認

成長

成長の推移 · 直近30日

128,542 Stars

推移データを蓄積中です。

開発アクティビティ

直近90日・週次

Commit(直近30日)
537
Open PR
1,587

開発アクティビティを蓄積中です。

Built with

カテゴリとタグ

GitHubデータ

GitHubのデータGitHubの詳細データを見る

GitHub Topics

  • ggml
Stars
128,542
Forks
23,317
Watchers
842
Open Issues
888
主要言語
C++
ライセンス
MIT
リポジトリ最終更新
2026/09/17

このOSSの使い方や活用事例をMarkdownで投稿できます。管理者が承認した後に公開されます。

情報の誤りを報告

掲載内容に誤りや古い情報があればお知らせください。

llama.cppとは?GGUF・量子化・Local LLM推論OSSを解説 | OSS探訪