概要
XGBoostは、Gradient Boostingの枠組みで決定木を逐次追加し、分類や回帰を行う高性能な機械学習ライブラリです。並列化やメモリ効率を重視した実装を持ち、Python、R、Javaなどから利用できます。単一マシンだけでなく、SparkやDaskなどの分散環境にも展開できます。
特徴と向いている用途
公式資料に基づく紹介・実機未検証 · 内容確認日:
Gradient Boosted Treesを高速に学習する
複数の弱い決定木を順に追加し、前段の誤差を補正するGradient Boostingを効率的に実装しています。表形式データの分類・回帰で使いやすいモデルです。
単一マシンから分散環境まで同じモデルを拡張する
ローカル実行に加え、Kubernetes、Hadoop、Spark、Daskなど複数の実行環境でスケールできることがREADMEで案内されています。
出典:[2]
表形式データで高性能な木ベースモデルを試したい場合に
カテゴリ変数の前処理後の表データや数値特徴量を使う分類・回帰で、線形モデルやRandom Forestに加えて強力な比較対象を用意したい場合に向きます。
ハイパーパラメータと過学習をcross-validationで管理する
木の深さ、学習率、木数、subsample、正則化などで結果が大きく変わります。訓練データだけのスコアで判断せず、適切なデータ分割とcross-validationで評価してください。
出典:[4]
参考にした公式資料
- [1]dmlc/xgboost repository(2026-09-20)
- [2]XGBoost README(2026-09-20)
- [3]XGBoost Apache-2.0 license(2026-09-20)
- [4]XGBoost documentation(2026-09-20)
編集部からの補足
表形式データの分類・回帰で強力なベースラインになりやすく、欠損値や非線形な関係を扱う木ベースモデルを高性能に学習できます。一方で木の深さ、学習率、木数、正則化などで性能と過学習が大きく変わるため、cross-validationを前提に調整するのが実務的です。
3ステップで試す
- 1
XGBoostを導入
Python APIを使うため、リリース版XGBoostを仮想環境へ導入します。
python -m pip install xgboost - 2
小さな分類モデルを学習
まず木数・深さ・学習率を明示した小さなモデルを作り、fit/predictの基本を確認します。
from xgboost import XGBClassifier; model=XGBClassifier(n_estimators=50, max_depth=3, learning_rate=0.1) - 3
cross-validationで過学習を確認
訓練スコアだけで判断せず、複数foldで汎化性能を確認してからパラメータを調整します。
Use StratifiedKFold + cross_val_score
成長
成長の推移 · 直近30日
28,778 Stars
推移データを蓄積中です。
開発アクティビティ
直近90日・週次
- Commit(直近30日)
- 43
- Open PR
- 38
- Issue登録
- 55
- Issue解決
- 49
- PR登録
- 261
- PRマージ
- 187
Issues
55 / 49
Pull Requests
261 / 187
メンテナンス状況
- Issue初回応答中央値
- 5.1時間
- Issue応答率
- 54.5% (18/33)
直近90日に外部から作成されたIssue(新しい順に最大100件)が対象です。OWNER・MEMBER・COLLABORATORによる最初のコメントを応答とし、全コメントを確認できないIssueは集計から除外します。中央値と応答率は週次更新です。
Built with
カテゴリとタグ
カテゴリ
GitHubデータ
GitHubのデータGitHubの詳細データを見る
GitHub Topics
- gbdt
- gbrt
- gbm
- distributed-systems
- xgboost
- machine-learning
- Stars
- 28,778
- Forks
- 8,901
- Watchers
- 886
- Open Issues
- 404
- Contributors
- 398
- 主要言語
- C++
- ライセンス
- Apache-2.0
- リポジトリ最終更新
- 2026/09/18
関連情報
関連記事を投稿するこのOSSの使い方や活用事例をMarkdownで投稿できます。管理者が承認した後に公開されます。
あわせて探訪
- Apache Superset74,847 Stars
no-code chart・SQL Lab・semantic layerで多数のSQL data sourceを可視化するOSS BI platform。
Python - OpenBB73,262 Stars
金融data providerをPython・REST API・MCPへ統合するanalyst/quant/AI agent向けOpen Data Platform。
Python - scikit-learn67,305 Stars
前処理・分類・回帰・clustering・model選択・評価を共通estimator APIで組むPython ML library。
Python - pandas49,751 Stars
DataFrameで表形式・label付きdataの欠損、結合、集計、変形、時系列、I/Oを扱うPython library。
Python - Apache Spark44,014 Stars
SQL・DataFrame・batch・stream・machine learningを統合する大規模data processing engine。
Scala
情報の誤りを報告
掲載内容に誤りや古い情報があればお知らせください。