【フルリモート/週5】Python データアーキテクト(ペタバイト級の大規模分散処理基盤とData Meshアーキテクチャの構築)

案件要件
- 職種
- エンジニア
- 業務内容
- システム開発・運用SES
- 報酬目安
- 4,600 ~ 5,100円/時
- 稼働時間目安
- 週5日 (時間目安 160時間)
- はたらく場所
- フルリモート
- スキル
【フルリモート/週5】Python データアーキテクト(ペタバイト級の大規模分散処理基盤とData Meshアーキテクチャの構築)
お任せしたいこと
自社で展開する大規模プラットフォーム、または膨大なトラフィックを抱えるグローバルサービスにおいて、AI・機械学習やビジネスの意思決定を根底から支える「モダンデータスタック」をPythonエコシステムを中心に設計・構築するデータアーキテクトをお任せします。
「誰が書いたか分からない野良のPandasスクリプト」や「エラーハンドリングのないCronバッチ処理」が引き起こす「サイレントなデータ欠損(Silent Data Corruption)」を徹底的に排除し、PySparkやApache Airflow、dbtを駆使した堅牢で冪等性のあるデータパイプラインの構築と、各ドメインチームが自律的にデータを管理する「Data Mesh(データメッシュ)」アーキテクチャへの移行を泥臭く牽引していただく中核的なポジションです。
具体的な業務内容
・Pythonおよび Apache Spark(PySpark)を活用した、テラバイト〜ペタバイト級の大規模分散データ処理(ETL/ELT)パイプラインの設計と実装
・Apache Airflowを利用した、数百〜数千のタスクが複雑に絡み合うDAG(有向非巡回グラフ)の泥臭い依存関係整理と、リトライ・バックフィル機構の実装
・dbt(data build tool)とJinja/Pythonを組み合わせた、データウェアハウス(SnowflakeやBigQuery)内でのスケーラブルなデータモデリングと変換処理のコード化
・Great Expectations 等のデータ品質(Data Quality)バリデーションフレームワークをパイプラインに組み込み、異常値やスキーマ変更を本番環境の川下へ流さないための防御的プログラミングの実装
・Apache KafkaやApache Flink(PyFlink)を活用した、ミリ秒単位の遅延が求められるリアルタイム・ストリーミング処理基盤の設計・構築
・データエンジニアリングへのソフトウェアエンジニアリング・ベストプラクティス(CI/CD、ユニットテスト、静的解析)の徹底的な導入
・DatahubやAmundsen等のデータカタログの運用、および全社的なデータガバナンス(アクセスコントロール、PIIのマスキング)の設計と仕組み化
・DatabricksやSnowflakeのコンピュートリソースに対する、Pythonからの動的プロビジョニングとクエリ実行計画(EXPLAIN)に基づく泥臭いパフォーマンスチューニング
必須スキル・経験
・Pythonを用いた大規模なデータパイプライン、またはバックエンドシステムの開発実務経験(目安として3年以上)
・PySpark、Hadoop等の分散処理フレームワークを用いた大規模データ処理の経験
・Apache Airflow、Prefect、Dagster等のワークフローオーケストレーションツールの運用経験
・高度なSQLの記述能力、およびRDBMSやDWHにおけるパフォーマンスチューニング経験
・Git / GitHubを用いたチーム開発経験、およびCI/CDの基礎知識
歓迎スキル・経験
・dbtを用いたデータモデリングの実務経験
・Snowflake、Databricks、BigQuery等のモダンデータプラットフォームのアーキテクチャ設計経験
・Great Expectations等を用いたデータ品質管理(Data Observability)の実装経験
・Apache Kafka、PyFlink等を用いたリアルタイムストリーミング基盤の構築経験
・Data MeshやData Fabricといった最新のデータアーキテクチャ概念に基づく組織設計・基盤構築の経験
開発・業務環境
開発言語:Python 3.11+, SQL (Jinja)
データ処理・変換:PySpark, Pandas, PyArrow, dbt, PyFlink
オーケストレーション:Apache Airflow (または Prefect, Dagster)
データ品質・ガバナンス:Great Expectations, Datahub
データベース・DWH:Snowflake, Databricks, Google BigQuery, PostgreSQL
ストリーミング:Apache Kafka
インフラ・コンテナ:AWS または GCP, Docker, Kubernetes, Terraform
コミュニケーション・管理:GitHub, Jira, Slack, Zoom, Notion
プロジェクトチームについて
「データはプロダクトである(Data as a Product)」という強い信念を持ち、機械学習モデルの精度も経営陣の意思決定も、すべてはクリーンなデータ基盤の上になりたつと確信するデータプラットフォームチームへの配属となります。
「分析基盤のダッシュボードの数字が、本番DBの数字と合わない」というデータエンジニアリング最大の恥辱を極めて嫌い、上流のマイクロサービスで発生した突然のスキーマ変更に対しても、下流のパイプラインが強靭に耐えうるデッドレターキュー(DLQ)や型バリデーションを泥臭く設計する手堅いカルチャーです。Airflowのタスクが謎のメモリ溢れ(OOM)で落ちた際にも、単にリソースを増やすのではなく、PySparkのシャッフル処理やパーティションサイズまで泥臭くプロファイリングし、根本からパズルを解き明かす実直なメンバーが集まっています。
求める人物像
・「単にデータを移動させるバッチスクリプトを書く」のではなく、データパイプライン自体を「テスト可能でバージョン管理されたソフトウェア」として扱うことにエンジニアとしての美学を持てる方
・属人化して誰も触れなくなった巨大なSQLやPandasのスパゲッティコードの解読から逃げず、dbtやPySparkを用いて美しくモジュール化されたモダンなスタックへとリファクタリングを楽しめる方
・データサイエンティスト(データの消費者)とバックエンドエンジニア(データの生産者)の両方の言語を理解し、サイロ化しがちな組織の橋渡し役を泥臭く担える方
仕事の魅力
生成AIや機械学習のビジネス活用が当たり前となった現代において、その心臓部である「クリーンなデータ」をリアルタイムかつスケーラブルに供給するパイプラインの価値はかつてなく高まっています。ペタバイト級のデータトラフィックと複雑な依存関係を持つ分散システムを、Pythonエコシステムの最先端ツール群で統制する泥臭い経験を通じて、単なる「スクリプトを書くデータエンジニア」を完全に凌駕し、AI時代においてすべてのテック企業が最も渇望する「シニア データアーキテクト」としての圧倒的な市場価値を築くことができます。
働き方
リモート環境
[フルリモート] 基本的にフルリモートで働いていただけます。
株式会社Kaizen Tech Agent
株式会社Kaizen Tech Agentは、「人と技術をつなぐ」ことを企業理念に掲げ、日々向上していく『技術』と『人』を最適な形でむつび付け提供することで、
お客様にとって真にプラスとなる価値でありたいと考えております。
私たちはそれぞれの個性を尊重し、ほっとする和みの社風でありながら、変化する時代に対して受け身にならず、未来への挑戦心を宿しています。
事業領域は、WEBアプリ開発、業務システム開発、スマホアプリ開発、インフラ構築など幅広く展開しており、
フリーランス様に対して最適な案件をご提案させて頂いております。どんな些細な事でも結構ですので是非いつでもお気軽にご相談ください。
