ページ内ナビ
概要
spaCyはproduction利用を想定したPython/Cython製NLP libraryです。linguistic tokenizationを基盤に、part-of-speech tagging、dependency parsing、named entity recognition、text classification、lemmatization、entity linking等をpipeline componentとして組み合わせ、70+言語のtokenization/trainingを扱えます。
特徴と向いている用途
公式資料に基づく紹介・実機未検証 · 内容確認日:
主な特徴
tokenizationからNER・parser・classifierまでpipeline化する
spaCyはtokenizerと複数のtrainable/non-trainable componentを順に適用するpipeline modelを採用し、文書解析を一つのDoc objectへ集約します。
出典:[1]
trained pipelineとcustom componentを組み合わせる
languageごとのtrained pipelineを導入しつつ、project固有ruleやPyTorch/TensorFlow modelをcustom componentとして拡張できます。
出典:[1]
training・packaging・deployment workflowまで一貫して扱う
READMEはproduction-ready training system、model packaging、deployment/workflow managementを主要機能として挙げています。
出典:[1]
向いている用途
大量textを再現可能なNLP pipelineで処理したい場合に向く
tokenization、NER、classification等を個別scriptではなくversioned pipelineとして学習・配備・再利用したいNLP applicationに適します。
出典:[1]
導入前の確認
spaCy本体とtrained pipelineのcompatibilityを別に管理する
library更新によってstatistical modelの再downloadが必要になる場合があります。productionではspaCy本体だけでなくpipeline packageとcustom componentのversionも固定します。
出典:[1]
3.8.16はPython 3.9以上3.15未満を宣言する
release-v3.8.16のpackage metadataではpython_requires = >=3.9,<3.15で、Python 3.9〜3.14 classifierを持ちます。
出典:[2]
参考にした公式資料
- [1]spaCy 3.8.16 README(2026-10-04)
- [2]spaCy 3.8.16 package metadata(2026-10-04)
- [3]spaCy 3.8.16 release(2026-10-04)
- [4]spaCy MIT license(2026-10-04)
編集部からの補足
spaCy本体とtrained pipelineは別versioned packageです。本体を更新したらspacy validate等でmodel compatibilityを確認し、productionではlibrary・pipeline・custom componentをまとめて固定してください。3.8.16はPython >=3.9,<3.15を宣言しています。
3ステップで試す
- 1
spaCy 3.8.16をvirtualenvへ導入する
stable 3.8.16をversion固定で導入します。trained modelはまだdownloadしません。
python3 -m venv spacy-demo && . spacy-demo/bin/activate && pip install 'spacy==3.8.16' - 2
blank English pipelineでtokenization sampleを作る
外部modelを使わず、spaCy本体のtokenizerとDoc APIだけを確認するsampleです。
printf 'import spacy\nnlp = spacy.blank("en")\ndoc = nlp("spaCy processes text.")\nprint([t.text for t in doc])\n' > spacy-demo/demo.py - 3
local tokenizerを実行する
network accessやGPUなしでtokenizationが動作することを確認します。trained pipeline導入時は別途version compatibilityを確認してください。
. spacy-demo/bin/activate && python spacy-demo/demo.py
成長
成長の推移 · 直近30日
33,935 Stars
推移データを蓄積中です。
開発アクティビティ
直近90日・週次
- Commit(直近30日)
- 1
- Open PR
- 70
開発アクティビティを蓄積中です。
Built with
カテゴリとタグ
GitHubデータ
GitHubのデータGitHubの詳細データを見る
関連情報
関連記事を投稿するこのOSSの使い方や活用事例をMarkdownで投稿できます。管理者が承認した後に公開されます。
あわせて探訪
- MLflow28,248 Stars
共通タグ 2件 · 同じ言語
ML experimentからLLM/Agent trace・評価・prompt・AI Gatewayまで一つのtracking/registry基盤へ統合する
Python - Apache Spark44,112 Stars
共通タグ 2件
SQL・DataFrame・stream・MLを同じdistributed engineで処理する
Scala - XGBoost28,822 Stars
共通タグ 2件
表形式データを中心にgradient-boosted treeをCPU/GPU・分散環境で学習する
C++ - LightGBM18,829 Stars
共通タグ 2件
高速・省メモリなGradient Boosted Treesを大規模データへ適用する
C++ - PyTorch103,630 Stars
共通タグ 3件 · 共通カテゴリ 2件 · 同じ言語
Pythonからテンソル計算と自動微分を扱う深層学習基盤
Python - Stable Diffusion WebUI164,915 Stars
共通タグ 3件 · 共通カテゴリ 1件 · 同じ言語
画像生成・部分編集・LoRA・拡張機能をブラウザでまとめて扱うGradio UI
Python
情報の誤りを報告
掲載内容に誤りや古い情報があればお知らせください。