エンジニアフルリモート

【フルリモート/週5】Pythonデータエンジニア(モダンデータスタック・ペタバイト級データパイプラインのアーキテクチャ設計)

【フルリモート/週5】Pythonデータエンジニア(モダンデータスタック・ペタバイト級データパイプラインのアーキテクチャ設計)

案件要件

職種
エンジニア
業務内容
システム開発・運用
SES
報酬目安
4,700 ~ 5,100円/時
稼働時間目安
週5日 (時間目安 160時間)
はたらく場所
フルリモート
スキル

【フルリモート/週5】Pythonデータエンジニア(モダンデータスタック・ペタバイト級データパイプラインのアーキテクチャ設計)

お任せしたいこと

自社プロダクトや全社横断のデータ利活用を根底から支えるため、Pythonおよびモダンデータスタック(dbt, Airflow, Snowflake/BigQuery等)を活用した、ペタバイト級のデータパイプラインとデータプラットフォームの設計・開発をお任せします。
「とりあえずCronで回すだけのスパゲッティ化されたバッチ処理」や「誰も品質を保証できないデータスワンプ(沼)」を徹底的に排除し、冪等性(Idempotency)とデータリネージを担保した堅牢なデータアーキテクチャを泥臭く構築することで、データサイエンティストや経営層が安全かつ最速でビジネス価値を引き出せる基盤を牽引していただく中核的なポジションです。

具体的な業務内容

・Python 3.x および Apache Airflow(または Prefect, Dagster)を用いた、複雑な依存関係を持つELT/ETLデータパイプラインの設計・開発とワークフロー自動化
・dbt(data build tool)を活用した、SQLによるデータモデリングのコード化(バージョン管理、テスト、ドキュメント生成の自動化)
・Snowflake または Google BigQuery 等のクラウドDWHにおける、ペタバイト規模のクエリパフォーマンス最適化およびコストチューニング
・Apache Kafka、Spark Streaming 等を用いた、リアルタイムに近い非同期ストリーミングデータ処理基盤の実装
・Great Expectations 等のツールを利用した、パイプライン上でのデータ品質(アノマリー、欠損、型の不一致)の継続的な監視と自動アラート機構の構築
・Terraformを用いたデータインフラのコード化(IaC)、およびGitHub Actionsを利用したDataOps(データパイプラインのCI/CD)環境の構築
・様々な外部SaaSのAPI(Salesforce, Zendesk等)やレガシーなオンプレミスRDBMSからの、レートリミットやネットワーク境界を考慮した泥臭いデータ抽出ロジックの実装

必須スキル・経験

・Pythonを用いたバックエンド開発、またはデータパイプライン構築の実務経験(目安として3年以上)
・複雑なSQLを用いたデータ抽出・加工、および実行計画を考慮したパフォーマンスチューニングの実務経験
・AWS、またはGCP等のパブリッククラウドを利用したインフラ構築・運用経験
・Git / GitHubを用いたプルリクエストベースでのチーム開発経験

歓迎スキル・経験

・Apache Airflow等のワークフローエンジンを用いた大規模なバッチ処理基盤の構築・運用経験
・dbtを用いたデータモデリング、およびデータウェアハウス(BigQuery, Snowflake, Redshift等)の実務運用経験
・Apache Spark等の分散処理フレームワークを利用したビッグデータ処理経験
・DataOpsの実践経験、またはデータガバナンス・メタデータ管理ツール(DataHub等)の導入経験
・基礎的な機械学習(ML)の知識、またはMLOps環境構築の支援経験

開発・業務環境

開発言語:Python 3.x, SQL
ワークフロー:Apache Airflow (または Prefect, Dagster)
データ変換・モデリング:dbt
DWH・データベース:Google BigQuery (または Snowflake), Amazon Redshift
分散処理・ストリーミング:Apache Spark, Apache Kafka, AWS Kinesis
インフラ・コンテナ:AWS または GCP, Docker, Kubernetes
品質・監視:Great Expectations, Datadog
コミュニケーション・管理:GitHub, Jira, Slack, Zoom

プロジェクトチームについて

「データこそが企業の最大の競争源泉である」と確信し、ソフトウェアエンジニアリングのベストプラクティスをデータ領域に持ち込むデータプラットフォームチームへの配属となります。
「データパイプラインが落ちたからアナリストが手動でリトライする」といった属人的な運用を極めて嫌い、障害が発生しても自動でリカバリ可能な冪等性のあるパイプライン構築を重視する手堅いカルチャーです。APIの突然の仕様変更や上流システムの謎のデータ欠損に直面した際にも、文句を言うのではなく、データ品質の監視をコード化して泥臭く検知・防御する実直なメンバーが集まっています。

求める人物像

・「データを右から左へ流すだけの作業者」ではなく、データのライフサイクル全体を俯瞰し、アーキテクチャの力でビジネスの意思決定を加速させることにエンジニアとしての美学を持てる方
・上流のRDBMSの勝手なスキーマ変更や、フォーマットの不揃いな汚いデータ(Dirty Data)に対して、パズルを解くように泥臭いクレンジングと前処理を楽しめる方
・データアナリストやMLエンジニアと密に連携し、「誰が、何のためにそのデータを使うのか」から逆算して、過不足のないテーブル設計を論理的に提案できる方

仕事の魅力

世界的な潮流である「モダンデータスタック(Modern Data Stack)」の最前線を体感し、ペタバイト級のビッグデータを扱う大規模基盤を少人数で構築・運用する、極めて影響力と社会的意義の高いポジションです。単なる「SQLやバッチ処理を書く人」を完全に凌駕し、ソフトウェアエンジニアリングとデータアナリティクスの境界を繋ぐ「シニア・データエンジニア(データ基盤アーキテクト)」としての圧倒的な市場価値を築くことができます。

働き方

リモート環境

[フルリモート] 基本的にフルリモートで働いていただけます。


SNSでこの案件をシェア

株式会社Kaizen Tech Agent

株式会社Kaizen Tech Agent

株式会社Kaizen Tech Agentは、「人と技術をつなぐ」ことを企業理念に掲げ、日々向上していく『技術』と『人』を最適な形でむつび付け提供することで、
お客様にとって真にプラスとなる価値でありたいと考えております。
私たちはそれぞれの個性を尊重し、ほっとする和みの社風でありながら、変化する時代に対して受け身にならず、未来への挑戦心を宿しています。
事業領域は、WEBアプリ開発、業務システム開発、スマホアプリ開発、インフラ構築など幅広く展開しており、
フリーランス様に対して最適な案件をご提案させて頂いております。どんな些細な事でも結構ですので是非いつでもお気軽にご相談ください。

案件を公開しました

案件をシェアしませんか?(SNSシェアをすることで、求職者の応募数アップが期待できます。)

案件を公開しました

この案件は限定公開です。案件のURLを知っている人のみが案件情報を見ることができます。

応募が完了しました

アピールしたいポイントがあれば積極的にメッセージを送ってみましょう。