ページ内ナビ
概要
TensorRT-LLMは、対応するNVIDIA GPUで大規模言語モデルの推論を最適化し、PythonまたはC++の実行環境やOpenAI互換サーバーとして提供するためのライブラリです。量子化、連続バッチ処理、複数GPU実行などを組み合わせ、応答速度と処理量を調整できます。
特徴と向いている用途
公式資料に基づく紹介・実機未検証 · 内容確認日:
主な特徴
向いている用途
導入前の確認
対応GPU、CUDA、ドライバー、メモリーを先にそろえる
v1.2.1の資料はLinux x86-64またはaarch64と、Blackwell、Grace Hopper、Hopper、Ada Lovelace、Ampere世代のNVIDIA GPUを対象にしています。公開イメージはCUDA 13.1系を基準とし、互換ドライバーが必要です。モデルの重み、KVキャッシュ、同時要求がGPUメモリーに収まる構成を選んでください。
参考にした公式資料
- [1]NVIDIA/TensorRT-LLM README at v1.2.1(2026-10-04)
- [2]TensorRT-LLM quick start at v1.2.1(2026-10-04)
- [3]TensorRT-LLM Linux installation guide at v1.2.1(2026-10-04)
- [4]TensorRT-LLM support matrix at v1.2.1(2026-10-04)
- [5]NVIDIA/TensorRT-LLM license file at v1.2.1(2026-10-04)
- [6]TensorRT-LLM v1.2.1 release(2026-10-04)
編集部からの補足
推論基盤を比較するときは、対象モデルとGPU世代を固定し、応答時間、同時処理数、GPUメモリー量を同じ入力で測ると判断しやすくなります。最初は公式コンテナーと小さい公開モデルで経路を確認してください。
3ステップで試す
- 1
固定版の公開コンテナーを取得する
対応するNVIDIA GPU、NVIDIA Container Toolkit、十分なGPUメモリーと保存容量を備えたLinuxで、v1.2.1の公式イメージを取得します。
docker pull nvcr.io/nvidia/tensorrt-llm/release:1.2.1 - 2
試す要求を作る
作業ディレクトリを作り、公開モデルTinyLlama-1.1B-Chat-v1.0へ送る要求を保存します。モデルのライセンスと利用条件を別に確認してください。
mkdir trtllm-tinyllama-demo && cd trtllm-tinyllama-demo && printf '%s\n' '{' ' "model": "TinyLlama/TinyLlama-1.1B-Chat-v1.0",' ' "messages": [{"role": "user", "content": "Reply with hello."}],' ' "max_tokens": 16' '}' > request.json - 3
起動、準備確認、推論、終了を一度に行う
名前を固定せずにコンテナーを起動し、取得できたコンテナーIDだけを終了します。/healthは各要求2秒、5秒間隔で60回まで(上限約7分)、準備完了後の推論は1回だけ120秒に制限し、応答をtinyllama-response.jsonへ保存します。準備できなければ推論しません。
( cid=''; cleanup() { if test -n "$cid"; then docker rm -f "$cid" >/dev/null 2>&1 || true; fi; }; trap cleanup EXIT INT TERM; cid=$(docker run -d --rm --ipc host --gpus all --ulimit memlock=-1 --ulimit stack=67108864 -p 127.0.0.1::8000 nvcr.io/nvidia/tensorrt-llm/release:1.2.1 trtllm-serve "TinyLlama/TinyLlama-1.1B-Chat-v1.0") || exit 1; port=$(docker port "$cid" 8000/tcp | sed -n 's/.*://p') || exit 1; test -n "$port" || exit 1; ready=0; for attempt in 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60; do if curl -fsS --connect-timeout 1 --max-time 2 "http://127.0.0.1:$port/health" -o health.txt; then ready=1; break; fi; sleep 5; done; test "$ready" = 1 || exit 1; curl -fsS --connect-timeout 2 --max-time 120 -X POST "http://127.0.0.1:$port/v1/chat/completions" -H 'Content-Type: application/json' --data-binary @request.json -o tinyllama-response.json || exit 1; test -s tinyllama-response.json )
成長
成長の推移 · 直近30日
14,763 Stars
推移データを蓄積中です。
開発アクティビティ
直近90日・週次
- Commit(直近30日)
- 688
- Open PR
- 959
- Issue登録
- 206
- Issue解決
- 198
- PR登録
- 3,557
- PRマージ
- 2,287
Issues
206 / 198
Pull Requests
3,557 / 2,287
メンテナンス状況
- Issue初回応答中央値
- 5.3日
- Issue応答率
- 19.5% (17/87)
直近90日に外部から作成されたIssue(新しい順に最大100件)が対象です。OWNER・MEMBER・COLLABORATORによる最初のコメントを応答とし、全コメントを確認できないIssueは集計から除外します。中央値と応答率は週次更新です。
Built with
カテゴリとタグ
GitHubデータ
関連情報
関連記事を投稿するこのOSSの使い方や活用事例をMarkdownで投稿できます。管理者が承認した後に公開されます。
あわせて探訪
- Crawl4AI84,764 Stars
共通タグ 1件 · 共通カテゴリ 2件 · 同じ言語
browser renderingしたWebをLLM-ready Markdown/JSONへ変換するPython crawler
Python - AutoGen61,263 Stars
共通タグ 1件 · 共通カテゴリ 2件 · 同じ言語
役割の異なるAIエージェントを会話とイベントで連携させ、複数段階の処理を構築するフレームワーク
Python - LiteLLM60,131 Stars
共通タグ 1件 · 共通カテゴリ 2件 · 同じ言語
100以上のLLM providerをOpenAI互換interfaceへ統一し、routing・cost・guardrail・loggingをAI Gatewayへ集約する
Python - CrewAI59,348 Stars
共通タグ 1件 · 共通カテゴリ 2件 · 同じ言語
role-based Crewとevent-driven Flowを組み合わせ、multi-agent automationを構築する
Python - Aider49,381 Stars
共通タグ 1件 · 共通カテゴリ 2件 · 同じ言語
リポジトリー全体の文脈を使ってターミナルからコードを編集する
Python - smolagents29,676 Stars
共通タグ 1件 · 共通カテゴリ 2件 · 同じ言語
コードでツールを呼び出すAIエージェントを、少ない抽象化で組み立てるPythonライブラリ
Python
情報の誤りを報告
掲載内容に誤りや古い情報があればお知らせください。