OSS探訪GitHubでログイン

NVIDIA GPU上で大規模言語モデルの推論処理を組み立てて提供する

スコアの見方

OSS規模スコアはStars・Watchers・Forks・Contributorsを対数圧縮して重み付けした現在の規模指標(上限なし)です。発掘スコアは現在のOSS規模スコアから発掘時点のOSS規模スコアを引いた値、更新ペースは直近30日Commit数、成長モメンタムは直近の観測期間におけるOSS規模スコア差、OSS健全度は取得できた更新状況・Community Health・Releaseの0〜100評価です。

Stars
14,763
主要言語
Python
ライセンス
未判定
リポジトリ最終更新
2026/10/05
ページ内ナビ

概要

TensorRT-LLMは、対応するNVIDIA GPUで大規模言語モデルの推論を最適化し、PythonまたはC++の実行環境やOpenAI互換サーバーとして提供するためのライブラリです。量子化、連続バッチ処理、複数GPU実行などを組み合わせ、応答速度と処理量を調整できます。

特徴と向いている用途

公式資料に基づく紹介・実機未検証 · 内容確認日:

主な特徴

モデルを最適化して推論サーバーとして公開する

対応モデルをTensorRTエンジンへ変換する経路に加え、trtllm-serveでHugging Faceのモデルを読み込み、OpenAI互換APIを公開できます。実行環境は要求をまとめ、KVキャッシュを管理してGPU利用を調整します。

出典:[1][2]

量子化と複数GPU構成で性能を調整する

FP8、FP4、INT8、INT4などの対応精度、in-flight batching、複数GPU・複数ノード構成をモデルとGPU世代に合わせて選べます。利用できる機能は、モデル、精度、GPUの組み合わせで異なります。

出典:[1][4]

向いている用途

NVIDIA GPUで生成AIの提供性能を詰めたい用途に向く

公開モデルの検証から専用推論サーバーまで、NVIDIA GPU上の応答速度、同時処理数、メモリー使用量を調整したいチームに向いています。CPUだけで動かす推論基盤や他社GPU向けの選択肢ではありません。

出典:[2][4]

導入前の確認

対応GPU、CUDA、ドライバー、メモリーを先にそろえる

v1.2.1の資料はLinux x86-64またはaarch64と、Blackwell、Grace Hopper、Hopper、Ada Lovelace、Ampere世代のNVIDIA GPUを対象にしています。公開イメージはCUDA 13.1系を基準とし、互換ドライバーが必要です。モデルの重み、KVキャッシュ、同時要求がGPUメモリーに収まる構成を選んでください。

出典:[3][4]

コンテナー、Python環境、モデルのライセンスを確認する

公式の公開コンテナーが推奨経路です。手動導入ではPython 3.12、CUDA Toolkit 13.1、対応するPyTorchとの整合を確認する必要があります。TensorRT-LLM本体はApache License 2.0ですが、同梱物と取得するモデルには別の条件があるため、それぞれのライセンスと利用条件を確認してください。

出典:[3][5][2]

参考にした公式資料

  1. [1]NVIDIA/TensorRT-LLM README at v1.2.1(2026-10-04)
  2. [2]TensorRT-LLM quick start at v1.2.1(2026-10-04)
  3. [3]TensorRT-LLM Linux installation guide at v1.2.1(2026-10-04)
  4. [4]TensorRT-LLM support matrix at v1.2.1(2026-10-04)
  5. [5]NVIDIA/TensorRT-LLM license file at v1.2.1(2026-10-04)
  6. [6]TensorRT-LLM v1.2.1 release(2026-10-04)
編集部からの補足

推論基盤を比較するときは、対象モデルとGPU世代を固定し、応答時間、同時処理数、GPUメモリー量を同じ入力で測ると判断しやすくなります。最初は公式コンテナーと小さい公開モデルで経路を確認してください。

3ステップで試す

  1. 1

    固定版の公開コンテナーを取得する

    対応するNVIDIA GPU、NVIDIA Container Toolkit、十分なGPUメモリーと保存容量を備えたLinuxで、v1.2.1の公式イメージを取得します。

    docker pull nvcr.io/nvidia/tensorrt-llm/release:1.2.1
  2. 2

    試す要求を作る

    作業ディレクトリを作り、公開モデルTinyLlama-1.1B-Chat-v1.0へ送る要求を保存します。モデルのライセンスと利用条件を別に確認してください。

    mkdir trtllm-tinyllama-demo && cd trtllm-tinyllama-demo && printf '%s\n' '{' ' "model": "TinyLlama/TinyLlama-1.1B-Chat-v1.0",' ' "messages": [{"role": "user", "content": "Reply with hello."}],' ' "max_tokens": 16' '}' > request.json
  3. 3

    起動、準備確認、推論、終了を一度に行う

    名前を固定せずにコンテナーを起動し、取得できたコンテナーIDだけを終了します。/healthは各要求2秒、5秒間隔で60回まで(上限約7分)、準備完了後の推論は1回だけ120秒に制限し、応答をtinyllama-response.jsonへ保存します。準備できなければ推論しません。

    ( cid=''; cleanup() { if test -n "$cid"; then docker rm -f "$cid" >/dev/null 2>&1 || true; fi; }; trap cleanup EXIT INT TERM; cid=$(docker run -d --rm --ipc host --gpus all --ulimit memlock=-1 --ulimit stack=67108864 -p 127.0.0.1::8000 nvcr.io/nvidia/tensorrt-llm/release:1.2.1 trtllm-serve "TinyLlama/TinyLlama-1.1B-Chat-v1.0") || exit 1; port=$(docker port "$cid" 8000/tcp | sed -n 's/.*://p') || exit 1; test -n "$port" || exit 1; ready=0; for attempt in 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60; do if curl -fsS --connect-timeout 1 --max-time 2 "http://127.0.0.1:$port/health" -o health.txt; then ready=1; break; fi; sleep 5; done; test "$ready" = 1 || exit 1; curl -fsS --connect-timeout 2 --max-time 120 -X POST "http://127.0.0.1:$port/v1/chat/completions" -H 'Content-Type: application/json' --data-binary @request.json -o tinyllama-response.json || exit 1; test -s tinyllama-response.json )
公式READMEで確認

成長

成長の推移 · 直近30日

14,763 Stars

推移データを蓄積中です。

開発アクティビティ

直近90日・週次

Commit(直近30日)
688
Open PR
959
Issue登録
206
Issue解決
198
PR登録
3,557
PRマージ
2,287

Issues

206 / 198

7月8日10月5日
Issue登録Issue解決

Pull Requests

3,557 / 2,287

7月8日10月5日
PR登録PRマージ

メンテナンス状況

Issue初回応答中央値
5.3日
Issue応答率
19.5% (17/87)

直近90日に外部から作成されたIssue(新しい順に最大100件)が対象です。OWNER・MEMBER・COLLABORATORによる最初のコメントを応答とし、全コメントを確認できないIssueは集計から除外します。中央値と応答率は週次更新です。

Built with

カテゴリとタグ

GitHubデータ

GitHubのデータGitHubの詳細データを見る

GitHub Topics

  • blackwell
  • cuda
  • moe
  • pytorch
  • llm-serving
Stars
14,763
Forks
2,796
Watchers
122
Open Issues
615
Contributors
423
所有者種別
Organization
主要言語
Python
ライセンス
未判定
リポジトリ最終更新
2026/10/05

このOSSの使い方や活用事例をMarkdownで投稿できます。管理者が承認した後に公開されます。

情報の誤りを報告

掲載内容に誤りや古い情報があればお知らせください。

このページを読んで、次に何をすればよいか分かりましたか?