OSS探訪GitHubでログイン

大規模言語・マルチモーダルモデルを低遅延で推論提供する

スコアの見方

OSS規模スコアはStars・Watchers・Forks・Contributorsを対数圧縮して重み付けした現在の規模指標(上限なし)です。発掘スコアは現在のOSS規模スコアから発掘時点のOSS規模スコアを引いた値、更新ペースは直近30日Commit数、成長モメンタムは直近の観測期間におけるOSS規模スコア差、OSS健全度は取得できた更新状況・Community Health・Releaseの0〜100評価です。

Stars
36,771
主要言語
Python
ライセンス
Apache-2.0
リポジトリ最終更新
2026/10/04
ページ内ナビ

概要

SGLangは、大規模言語モデルとマルチモーダルモデルをHTTP経由で提供する推論基盤です。接頭辞キャッシュ、継続的な一括処理、投機的デコード、複数の並列化方式を組み合わせ、単一GPUから分散構成まで応答速度と処理量を調整できます。

特徴と向いている用途

公式資料に基づく紹介・実機未検証 · 内容確認日:

主な特徴

モデル実行とOpenAI互換APIを一つの基盤へまとめる

Llama、Qwen、DeepSeek、Kimi、GLM、GPT、Gemma、Mistralなどの言語モデルに加え、埋め込み、報酬、画像・動画生成モデルを対象にしています。RadixAttentionによる接頭辞キャッシュ、ページ化したアテンション、量子化、LoRAの一括処理を備え、OpenAI互換APIと独自の生成APIから呼び出せます。

出典:[1][2]

向いている用途

モデルごとの推論方式を共通の提供面へ集約する

複数のアプリケーションから同じモデルを利用し、要求の一括処理、構造化出力、複数GPUへの分割を推論層で管理したい場面に向きます。単一GPUで小さなモデルを試した後、実際の入力長と同時実行数で測定し、テンソル、パイプライン、専門家、データの各並列化を必要に応じて選べます。

出典:[1]

導入前の確認

GPU、モデル互換性、公開時の防御を個別に検証する

v0.5.21はPython 3.10以上を要求し、標準のNVIDIA向け導入はCUDA 13を前提にします。公式クイックスタートはLinuxとsm80以上のNVIDIA GPUを推奨しますが、AMD GPU、CPU、TPU、NPUなどは専用手順と対応範囲が異なります。Hugging Face互換だからといって全モデルや拡張コードの動作が保証されるわけではありません。ローカル例は認証ヘッダーなしで応答するため、外部公開時は認証とアクセス制御が必要です。GitHubはApache-2.0と表示しています。

出典:[3][2][4][5][6]

参考にした公式資料

  1. [1]SGLang v0.5.21 README(2026-10-04)
  2. [2]SGLang v0.5.21 quickstart(2026-10-04)
  3. [3]SGLang v0.5.21 installation guide(2026-10-04)
  4. [4]SGLang v0.5.21 Python package metadata(2026-10-04)
  5. [5]sgl-project/sglang GitHub repository metadata(2026-10-04)
  6. [6]SGLang v0.5.21 LICENSE(2026-10-04)
編集部からの補足

採用前に対象モデル、量子化方式、最大文脈長を実機GPUのメモリーへ載せ、同時要求時の遅延と処理量を測ってください。ローカル例には認証がないため、外部公開時は認証、通信暗号化、利用制限を別途設計します。

3ステップで試す

  1. 1

    Python環境を分ける

    Python 3.10以上、Linux、CUDA 13、sm80以上のNVIDIA GPUを前提に、試行用の仮想環境を有効にします。以降も同じ端末と作業ディレクトリを使います。

    python3 -m venv sglang-demo-env && . sglang-demo-env/bin/activate
  2. 2

    SGLang 0.5.21を導入する

    確認した固定版を仮想環境へ導入します。モデル本体は次の手順で公開されたQwenの小型モデルを取得するため、ネットワーク接続と十分な空き容量が必要です。

    python -m pip install "sglang==0.5.21"
  3. 3

    ローカル推論へ要求を送る

    公開モデルを127.0.0.1だけで起動し、1秒の接続・要求上限を持つ確認を最大60回、1秒間隔で行います。約120秒以内に準備できなければログを表示して失敗し、chat APIへは進みません。準備後の要求も30秒で打ち切り、空でない応答を確認します。サブシェルは成功・失敗のどちらでも終了時にサーバーを停止し、呼び出し元へtrapを残しません。外部公開用の認証確認ではありません。

    ( sglang serve --model-path qwen/qwen2.5-0.5b-instruct --host 127.0.0.1 --port 30000 > sglang.log 2>&1 & server_pid=$!; trap 'kill "$server_pid" 2>/dev/null || true; wait "$server_pid" 2>/dev/null || true' EXIT; ready=0; for attempt in 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60; do if curl -fsS --connect-timeout 1 --max-time 1 http://127.0.0.1:30000/health >/dev/null 2>&1; then ready=1; break; fi; kill -0 "$server_pid" 2>/dev/null || { cat sglang.log; exit 1; }; sleep 1; done; if test "$ready" != 1; then cat sglang.log; exit 1; fi; curl -fsS --connect-timeout 2 --max-time 30 http://127.0.0.1:30000/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"qwen/qwen2.5-0.5b-instruct","messages":[{"role":"user","content":"Reply with OK"}],"temperature":0,"max_tokens":8}' > response.json && python -c 'import json; data=json.load(open("response.json")); assert data["choices"][0]["message"]["content"].strip()' )
公式READMEで確認

成長

成長の推移 · 直近30日

36,771 Stars

推移データを蓄積中です。

開発アクティビティ

直近90日・週次

Commit(直近30日)
1,606
Open PR
4,614

開発アクティビティを蓄積中です。

Built with

カテゴリとタグ

GitHubデータ

GitHubのデータGitHubの詳細データを見る

GitHub Topics

  • cuda
  • inference
  • llama
  • llm
  • moe
  • transformer
  • vlm
  • deepseek
  • blackwell
  • gpt-oss
  • diffusion
  • attention
Stars
36,771
Forks
9,311
Watchers
184
Open Issues
932
Contributors
449
所有者種別
Organization
主要言語
Python
ライセンス
Apache-2.0
リポジトリ最終更新
2026/10/04

このOSSの使い方や活用事例をMarkdownで投稿できます。管理者が承認した後に公開されます。

情報の誤りを報告

掲載内容に誤りや古い情報があればお知らせください。

このページを読んで、次に何をすればよいか分かりましたか?