OSS探訪GitHubでログイン

Hugging Face Hubとlocal dataをApache Arrow基盤でload・transform・streamするML dataset library

スコアの見方

OSS規模スコアはStars・Watchers・Forks・Contributorsを対数圧縮して重み付けした現在の規模指標(上限なし)です。発掘スコアは現在のOSS規模スコアから発掘時点のOSS規模スコアを引いた値、更新ペースは直近30日Commit数、成長モメンタムは直近の観測期間におけるOSS規模スコア差、OSS健全度は取得できた更新状況・Community Health・Releaseの0〜100評価です。

Stars
22,029
主要言語
Python
ライセンス
Apache-2.0
リポジトリ最終更新
2026/10/05
ページ内ナビ

概要

Hugging Face DatasetsはAI/ML向けdatasetをload・前処理・共有するPython libraryです。Hub上のdatasetやCSV/JSON/Parquet等のlocal fileを統一APIで読み込み、Apache Arrowによるmemory-mapped処理、cache、streaming、multi-processingを使ってtraining/evaluation用data pipelineを構築できます。

特徴と向いている用途

公式資料に基づく紹介・実機未検証 · 内容確認日:

主な特徴

Hubとlocal fileをload_datasetで統一的に読み込む

Hugging Face Hub上のdatasetに加え、CSV、JSON/JSONL、Parquet、Arrow、text、image、audio、video、PDF等を同じlibraryから扱えます。

出典:[1]

Apache Arrow・cache・multi-processingで前処理を効率化する

DatasetはArrow-backed storageとmemory mappingを利用し、map等のtransform結果をcacheできます。multi-processingを使ったparallel preprocessingにも対応します。

出典:[1]

large datasetをdownloadせずstreamingで逐次処理する

streaming=TrueでIterableDatasetとしてdataを逐次取得でき、diskへ全量保存せずlarge-scale datasetをiterateできます。NumPy、Pandas、Polars、PyTorch、TensorFlow、JAX等とのinteropも提供します。

出典:[1]

向いている用途

training・evaluation用datasetの取得と前処理を再現可能なPython pipelineへまとめたい場合に向く

dataset source、split、transform、format conversionをcodeで管理し、model trainingやevaluationで同じdata preparationを再利用したいML workflowに適します。

出典:[1]

導入前の確認

5.0.1はPython 3.10以上とPyArrow 21以上を要求する

5.0.1のpackage metadataはPython >=3.10.0、pyarrow>=21.0.0を要求し、fsspecやhuggingface-hub等にもversion constraintがあります。環境upgrade時は依存互換性を確認してください。

出典:[3][4]

5.0.1はarchive extractionとmetadata pathのsecurity fixを含む

5.0.1ではsymlink追跡によるarbitrary file writeと、folder-based builderのmetadata file_nameを利用したpath traversalが修正されています。untrusted archiveやdataset metadataを扱う環境では5.0.1以降を優先してください。

出典:[2]

参考にした公式資料

  1. [1]Datasets 5.0.1 README(2026-10-04)
  2. [2]Datasets 5.0.1 release(2026-10-04)
  3. [3]Datasets 5.0.1 package metadata(2026-10-04)
  4. [4]Datasets 5.0.1 version metadata(2026-10-04)
  5. [5]Datasets Apache 2.0 license(2026-10-04)
編集部からの補足

Hub datasetは内容・license・revisionが個別に異なります。library自体のApache-2.0と、取得するdatasetのlicenseを同一視せず、再現性のためdataset revisionもpinしてください。

3ステップで試す

  1. 1

    Datasets 5.0.1用virtual environmentを作る

    Python environmentを分離し、security fixを含む5.0.1へversion固定します。

    python3 -m venv datasets-demo && . datasets-demo/bin/activate && python -m pip install --upgrade pip && python -m pip install 'datasets==5.0.1'
  2. 2

    network accessなしでin-memory Datasetを作る

    Hubへ接続せず、local Python objectからArrow-backed Datasetを生成します。

    . datasets-demo/bin/activate && python -c 'from datasets import Dataset; d=Dataset.from_dict({"text":["alpha","beta","gamma"]}); print(d)'
  3. 3

    mapでlocal transformを試す

    downloadやmodel trainingを行わず、Dataset transformation APIと出力を確認します。

    . datasets-demo/bin/activate && python -c 'from datasets import Dataset; d=Dataset.from_dict({"text":["alpha","beta","gamma"]}); d=d.map(lambda x:{"length":len(x["text"])}); print(d.to_dict())'
公式READMEで確認

成長

成長の推移 · 直近30日

22,029 Stars

推移データを蓄積中です。

開発アクティビティ

直近90日・週次

Commit(直近30日)
38
Open PR
508

開発アクティビティを蓄積中です。

Built with

カテゴリとタグ

GitHubデータ

GitHubのデータGitHubの詳細データを見る

GitHub Topics

  • nlp
  • datasets
  • pytorch
  • tensorflow
  • pandas
  • numpy
  • natural-language-processing
  • computer-vision
  • machine-learning
  • deep-learning
  • speech
  • ai
Stars
22,029
Forks
3,493
Watchers
283
Open Issues
943
Contributors
444
所有者種別
Organization
主要言語
Python
ライセンス
Apache-2.0
リポジトリ最終更新
2026/10/05

このOSSの使い方や活用事例をMarkdownで投稿できます。管理者が承認した後に公開されます。

情報の誤りを報告

掲載内容に誤りや古い情報があればお知らせください。

このページを読んで、次に何をすればよいか分かりましたか?