OSS探訪

Apache Spark — SQL・DataFrame・stream・MLを統合する大規模data engine

OSS健全度 95
スコアの見方

発掘スコアはStars・Watchers・Forks・Contributorsを対数圧縮して重み付けした独自指標(上限なし)。成長モメンタムは観測期間内の同スコアの差、OSS健全度は取得できた更新状況・Community Health・Releaseの0〜100評価です。

Stars
43,989
主要言語
Scala
ライセンス
Apache-2.0
リポジトリ最終更新
2026/09/13

概要

Apache Sparkは、大規模data processing向けのunified analytics engineです。Scala、Java、Pythonのhigh-level APIと最適化engineを基盤に、Spark SQLとDataFrame、pandas API on Spark、MLlib、GraphX、Structured Streamingを一つのprojectで提供します。

特徴と向いている用途

公式資料に基づく紹介・実機未検証 · 内容確認日:

batchからSQL・stream・machine learningまで同じengineで扱う

現行READMEは、general computation graphを実行するengineに、Spark SQLとDataFrame、pandas workload向けAPI、machine learningのMLlib、graph processingのGraphX、stream processingのStructured Streamingを組み合わせると説明します。Scala shellとPySpark shell、example program、test手順もrepositoryから案内されます。

出典:[1]

複数nodeで大規模data workflowを統合したい場合

大量のbatch集計、interactive SQL、feature engineering、stream処理を共通のcluster基盤へ寄せたいdata teamの候補です。実際のdata量とskewを使い、partition、shuffle、memory、serialization、connector、failure recovery、costを検証してください。

出典:[1]

development branchとrelease文書、language対応を区別する

READMEはbasic setupだけを扱い、利用者にはproject siteのversion別documentationを案内します。masterのbuild手順をそのままproduction releaseへ当てはめず、Hadoop・Java・Scala・Pythonの互換表を選択versionで確認してください。R APIはREADMEでDeprecatedと明記されています。licenseはApache-2.0です。

出典:[1][2]

参考にした公式資料

  1. [1]Apache Spark README(2026-09-13)
  2. [2]Apache Spark license(2026-09-13)
編集部からの補足

一般語SparkをApacheの識別語で絞り、SQL・DataFrame・stream・MLの機能別文書が巨大なlong-tail検索面を作る例として選びました。

成長

成長の推移 · 直近30日

43,989 Stars

推移データを蓄積中です。

開発アクティビティ

直近90日・週次

Commit(直近30日)
464
Open PR
517

開発アクティビティを蓄積中です。

Built with

カテゴリとタグ

GitHubデータ

GitHubのデータGitHubの詳細データを見る

GitHub Topics

  • python
  • scala
  • r
  • java
  • big-data
  • jdbc
  • sql
  • spark
Stars
43,989
Forks
29,371
Watchers
1,998
Open Issues
32
主要言語
Scala
ライセンス
Apache-2.0
リポジトリ最終更新
2026/09/13
情報の誤りを報告

掲載内容に誤りや古い情報があればお知らせください。