ページ内ナビ
概要
Hugging Face DatasetsはAI/ML向けdatasetをload・前処理・共有するPython libraryです。Hub上のdatasetやCSV/JSON/Parquet等のlocal fileを統一APIで読み込み、Apache Arrowによるmemory-mapped処理、cache、streaming、multi-processingを使ってtraining/evaluation用data pipelineを構築できます。
特徴と向いている用途
公式資料に基づく紹介・実機未検証 · 内容確認日:
主な特徴
Hubとlocal fileをload_datasetで統一的に読み込む
Hugging Face Hub上のdatasetに加え、CSV、JSON/JSONL、Parquet、Arrow、text、image、audio、video、PDF等を同じlibraryから扱えます。
出典:[1]
Apache Arrow・cache・multi-processingで前処理を効率化する
DatasetはArrow-backed storageとmemory mappingを利用し、map等のtransform結果をcacheできます。multi-processingを使ったparallel preprocessingにも対応します。
出典:[1]
large datasetをdownloadせずstreamingで逐次処理する
streaming=TrueでIterableDatasetとしてdataを逐次取得でき、diskへ全量保存せずlarge-scale datasetをiterateできます。NumPy、Pandas、Polars、PyTorch、TensorFlow、JAX等とのinteropも提供します。
出典:[1]
向いている用途
training・evaluation用datasetの取得と前処理を再現可能なPython pipelineへまとめたい場合に向く
dataset source、split、transform、format conversionをcodeで管理し、model trainingやevaluationで同じdata preparationを再利用したいML workflowに適します。
出典:[1]
導入前の確認
5.0.1はPython 3.10以上とPyArrow 21以上を要求する
5.0.1のpackage metadataはPython >=3.10.0、pyarrow>=21.0.0を要求し、fsspecやhuggingface-hub等にもversion constraintがあります。環境upgrade時は依存互換性を確認してください。
5.0.1はarchive extractionとmetadata pathのsecurity fixを含む
5.0.1ではsymlink追跡によるarbitrary file writeと、folder-based builderのmetadata file_nameを利用したpath traversalが修正されています。untrusted archiveやdataset metadataを扱う環境では5.0.1以降を優先してください。
出典:[2]
参考にした公式資料
- [1]Datasets 5.0.1 README(2026-10-04)
- [2]Datasets 5.0.1 release(2026-10-04)
- [3]Datasets 5.0.1 package metadata(2026-10-04)
- [4]Datasets 5.0.1 version metadata(2026-10-04)
- [5]Datasets Apache 2.0 license(2026-10-04)
編集部からの補足
Hub datasetは内容・license・revisionが個別に異なります。library自体のApache-2.0と、取得するdatasetのlicenseを同一視せず、再現性のためdataset revisionもpinしてください。
3ステップで試す
- 1
Datasets 5.0.1用virtual environmentを作る
Python environmentを分離し、security fixを含む5.0.1へversion固定します。
python3 -m venv datasets-demo && . datasets-demo/bin/activate && python -m pip install --upgrade pip && python -m pip install 'datasets==5.0.1' - 2
network accessなしでin-memory Datasetを作る
Hubへ接続せず、local Python objectからArrow-backed Datasetを生成します。
. datasets-demo/bin/activate && python -c 'from datasets import Dataset; d=Dataset.from_dict({"text":["alpha","beta","gamma"]}); print(d)' - 3
mapでlocal transformを試す
downloadやmodel trainingを行わず、Dataset transformation APIと出力を確認します。
. datasets-demo/bin/activate && python -c 'from datasets import Dataset; d=Dataset.from_dict({"text":["alpha","beta","gamma"]}); d=d.map(lambda x:{"length":len(x["text"])}); print(d.to_dict())'
成長
成長の推移 · 直近30日
22,029 Stars
推移データを蓄積中です。
開発アクティビティ
直近90日・週次
- Commit(直近30日)
- 38
- Open PR
- 508
開発アクティビティを蓄積中です。
Built with
カテゴリとタグ
GitHubデータ
GitHubのデータGitHubの詳細データを見る
GitHub Topics
- nlp
- datasets
- pytorch
- tensorflow
- pandas
- numpy
- natural-language-processing
- computer-vision
- machine-learning
- deep-learning
- speech
- ai
- Stars
- 22,029
- Forks
- 3,493
- Watchers
- 283
- Open Issues
- 943
- Contributors
- 444
- 所有者種別
- Organization
- 主要言語
- Python
- ライセンス
- Apache-2.0
- リポジトリ最終更新
- 2026/10/05
関連情報
関連記事を投稿するこのOSSの使い方や活用事例をMarkdownで投稿できます。管理者が承認した後に公開されます。
あわせて探訪
- AutoGen61,263 Stars
共通タグ 2件 · 共通カテゴリ 1件 · 同じ言語
役割の異なるAIエージェントを会話とイベントで連携させ、複数段階の処理を構築するフレームワーク
Python - Apache Airflow47,054 Stars
共通タグ 2件 · 共通カテゴリ 1件 · 同じ言語
DAGをコードで定義し、データ・ML・AI処理を編成するworkflow基盤
Python - Ray43,970 Stars
共通タグ 2件 · 共通カテゴリ 1件 · 同じ言語
Python/AI処理をタスク・アクター・オブジェクトでローカルからクラスターへ広げる分散実行基盤
Python - Gradio43,672 Stars
共通タグ 2件 · 共通カテゴリ 1件 · 同じ言語
Python関数やML modelにWeb UI・chat UI・share endpointを付けるapplication framework
Python - JAX36,377 Stars
共通タグ 2件 · 共通カテゴリ 1件 · 同じ言語
Python・NumPy風の計算に自動微分、JITコンパイル、ベクトル化、分散実行を組み合わせる
Python - spaCy33,939 Stars
共通タグ 2件 · 共通カテゴリ 1件 · 同じ言語
tokenization・NER・tagging・parsing・text classification・trainingをproduction向けPython/Cython pipelineとして提供するNLP library
Python
情報の誤りを報告
掲載内容に誤りや古い情報があればお知らせください。