ページ内ナビ
概要
SGLangは、大規模言語モデルとマルチモーダルモデルをHTTP経由で提供する推論基盤です。接頭辞キャッシュ、継続的な一括処理、投機的デコード、複数の並列化方式を組み合わせ、単一GPUから分散構成まで応答速度と処理量を調整できます。
特徴と向いている用途
公式資料に基づく紹介・実機未検証 · 内容確認日:
主な特徴
向いている用途
モデルごとの推論方式を共通の提供面へ集約する
複数のアプリケーションから同じモデルを利用し、要求の一括処理、構造化出力、複数GPUへの分割を推論層で管理したい場面に向きます。単一GPUで小さなモデルを試した後、実際の入力長と同時実行数で測定し、テンソル、パイプライン、専門家、データの各並列化を必要に応じて選べます。
出典:[1]
導入前の確認
参考にした公式資料
- [1]SGLang v0.5.21 README(2026-10-04)
- [2]SGLang v0.5.21 quickstart(2026-10-04)
- [3]SGLang v0.5.21 installation guide(2026-10-04)
- [4]SGLang v0.5.21 Python package metadata(2026-10-04)
- [5]sgl-project/sglang GitHub repository metadata(2026-10-04)
- [6]SGLang v0.5.21 LICENSE(2026-10-04)
編集部からの補足
採用前に対象モデル、量子化方式、最大文脈長を実機GPUのメモリーへ載せ、同時要求時の遅延と処理量を測ってください。ローカル例には認証がないため、外部公開時は認証、通信暗号化、利用制限を別途設計します。
3ステップで試す
- 1
Python環境を分ける
Python 3.10以上、Linux、CUDA 13、sm80以上のNVIDIA GPUを前提に、試行用の仮想環境を有効にします。以降も同じ端末と作業ディレクトリを使います。
python3 -m venv sglang-demo-env && . sglang-demo-env/bin/activate - 2
SGLang 0.5.21を導入する
確認した固定版を仮想環境へ導入します。モデル本体は次の手順で公開されたQwenの小型モデルを取得するため、ネットワーク接続と十分な空き容量が必要です。
python -m pip install "sglang==0.5.21" - 3
ローカル推論へ要求を送る
公開モデルを127.0.0.1だけで起動し、1秒の接続・要求上限を持つ確認を最大60回、1秒間隔で行います。約120秒以内に準備できなければログを表示して失敗し、chat APIへは進みません。準備後の要求も30秒で打ち切り、空でない応答を確認します。サブシェルは成功・失敗のどちらでも終了時にサーバーを停止し、呼び出し元へtrapを残しません。外部公開用の認証確認ではありません。
( sglang serve --model-path qwen/qwen2.5-0.5b-instruct --host 127.0.0.1 --port 30000 > sglang.log 2>&1 & server_pid=$!; trap 'kill "$server_pid" 2>/dev/null || true; wait "$server_pid" 2>/dev/null || true' EXIT; ready=0; for attempt in 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60; do if curl -fsS --connect-timeout 1 --max-time 1 http://127.0.0.1:30000/health >/dev/null 2>&1; then ready=1; break; fi; kill -0 "$server_pid" 2>/dev/null || { cat sglang.log; exit 1; }; sleep 1; done; if test "$ready" != 1; then cat sglang.log; exit 1; fi; curl -fsS --connect-timeout 2 --max-time 30 http://127.0.0.1:30000/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"qwen/qwen2.5-0.5b-instruct","messages":[{"role":"user","content":"Reply with OK"}],"temperature":0,"max_tokens":8}' > response.json && python -c 'import json; data=json.load(open("response.json")); assert data["choices"][0]["message"]["content"].strip()' )
成長
成長の推移 · 直近30日
36,771 Stars
推移データを蓄積中です。
開発アクティビティ
直近90日・週次
- Commit(直近30日)
- 1,606
- Open PR
- 4,614
開発アクティビティを蓄積中です。
Built with
カテゴリとタグ
GitHubデータ
GitHubのデータGitHubの詳細データを見る
GitHub Topics
- cuda
- inference
- llama
- llm
- moe
- transformer
- vlm
- deepseek
- blackwell
- gpt-oss
- diffusion
- attention
- Stars
- 36,771
- Forks
- 9,311
- Watchers
- 184
- Open Issues
- 932
- Contributors
- 449
- 所有者種別
- Organization
- 主要言語
- Python
- ライセンス
- Apache-2.0
- リポジトリ最終更新
- 2026/10/04
関連情報
関連記事を投稿するこのOSSの使い方や活用事例をMarkdownで投稿できます。管理者が承認した後に公開されます。
あわせて探訪
- Khoj37,559 Stars
共通タグ 2件 · 共通カテゴリ 1件 · 同じ言語
文書・Web・local/cloud LLMをRAG・Agent・Automationへまとめるpersonal AI
Python - Onyx32,323 Stars
共通タグ 2件 · 共通カテゴリ 1件 · 同じ言語
社内knowledgeをAI agentが使えるcontext layerへ変換する
Python - smolagents29,670 Stars
共通タグ 2件 · 共通カテゴリ 1件 · 同じ言語
コードでツールを呼び出すAIエージェントを、少ない抽象化で組み立てるPythonライブラリ
Python - Transformers166,931 Stars
共通タグ 3件 · 共通カテゴリ 1件 · 同じ言語
text・vision・audio・multimodal modelを共通AutoClass/Pipeline APIでload・inference・trainingするmodel-definition framework
Python - DeepSeek-V3104,507 Stars
共通タグ 3件 · 共通カテゴリ 1件 · 同じ言語
671B parameterのMoE LLMとFP8/multi-node inference向けreference implementationを公開する
Python - TRL19,450 Stars
共通タグ 3件 · 共通カテゴリ 1件 · 同じ言語
基盤モデルの教師あり微調整と選好学習を、共通のTrainerとCLIで進めるPythonライブラリ
Python
情報の誤りを報告
掲載内容に誤りや古い情報があればお知らせください。