ページ内ナビ
概要
Daskはanalytics向けのflexible parallel computing libraryです。Dask Array、DataFrame、Bag等のhigh-level collectionがtask graphを生成し、schedulerがsingle machineまたはcluster上でlazy computationを実行します。
特徴と向いている用途
公式資料に基づく紹介・実機未検証 · 内容確認日:
主な特徴
Array・DataFrame等をpartitionしてlazy task graphを作る
Dask collectionはdataをchunk/partitionへ分割し、operationを即時実行せずtask graphとして構築します。結果が必要になった時点でcompute()によりschedulerへ実行を依頼します。
向いている用途
導入前の確認
partition sizeとtask granularityを調整してscheduler overheadを抑える
Daskはtask graphとpartition単位で実行するため、非常に小さいtaskを大量に作る構成ではscheduler overheadが相対的に大きくなります。data sizeとoperationに合わせてchunk/partitionを設計します。
出典:[2]
参考にした公式資料
- [1]Dask 2026.8.0 README(2026-10-03)
- [2]Dask 2026.8.0 ten-minute guide(2026-10-03)
- [3]Dask 2026.8.0 installation guide(2026-10-03)
- [4]Dask 2026.8.0 package metadata(2026-10-03)
- [5]Dask 2026.8.0 release(2026-10-03)
編集部からの補足
既存のNumPy/pandas的な操作を保ちながらdataをpartitionし、memoryやCPUの上限を越える処理へ段階的に拡張できます。小さいdataではscheduler overheadが増えるため、まずpartition sizeとtask数を可視化してからdistributed化するのが有効です。
3ステップで試す
- 1
検証用Python virtual environmentを作成する
Dask 2026.8.0が要求するPython 3.10以上で独立した環境を作成します。
python3 -m venv .venv && . .venv/bin/activate - 2
Dask Array 2026.8.0をinstallする
core DaskとNumPyを含むArray向けdependencyをversion固定して導入します。
python -m pip install "dask[array]==2026.8.0" - 3
chunked arrayをlazy計算する
100要素を4 chunkへ分割し、task graphを構築してからcomputeで実行します。distributed clusterを使う場合は同系列のdistributed packageを追加してください。
python -c 'import dask.array as da; x=da.arange(100, chunks=25); print(x.sum().compute())'
成長
成長の推移 · 直近30日
13,931 Stars
推移データを蓄積中です。
開発アクティビティ
直近90日・週次
- Commit(直近30日)
- 1
- Open PR
- 307
開発アクティビティを蓄積中です。
Built with
カテゴリとタグ
GitHubデータ
GitHubのデータGitHubの詳細データを見る
GitHub Topics
- dask
- python
- pydata
- numpy
- pandas
- scikit-learn
- scipy
- Stars
- 13,931
- Forks
- 1,971
- Watchers
- 203
- Open Issues
- 1,043
- Contributors
- 416
- 所有者種別
- Organization
- 主要言語
- Python
- ライセンス
- BSD-3-Clause
- リポジトリ最終更新
- 2026/09/29
関連情報
関連記事を投稿するこのOSSの使い方や活用事例をMarkdownで投稿できます。管理者が承認した後に公開されます。
あわせて探訪
- scikit-learn67,463 Stars
共通タグ 1件 · 共通カテゴリ 1件 · 同じ言語
前処理・学習・model selection・評価を共通estimator APIとPipelineで組み立てるPython機械学習library
Python - Apache Airflow47,037 Stars
共通タグ 1件 · 共通カテゴリ 1件 · 同じ言語
DAGをコードで定義し、データ・ML・AI処理を編成するworkflow基盤
Python - pandas49,908 Stars
共通タグ 4件 · 共通カテゴリ 2件 · 同じ言語
Series・DataFrameでlabel付き表形式・時系列dataを整形・結合・集計・入出力するPython data analysis library
Python - Apache Spark44,112 Stars
共通タグ 4件 · 共通カテゴリ 2件
SQL・DataFrame・stream・MLを同じdistributed engineで処理する
Scala - Apache Arrow17,172 Stars
共通タグ 2件 · 共通カテゴリ 3件
列指向データを共通のメモリ形式で受け渡し、分析処理の変換とコピーを減らす
C++ - Matplotlib23,319 Stars
共通タグ 2件 · 共通カテゴリ 2件 · 同じ言語
plot・figure・backendを組み合わせて静的・animated・interactiveな可視化を作るPython plotting library
Python
情報の誤りを報告
掲載内容に誤りや古い情報があればお知らせください。