【フルリモート/週5】Pythonデータエンジニア(大規模データ基盤構築・ETLパイプライン設計)

案件要件
- 職種
- エンジニア
- 業務内容
- システム開発・運用SES
- 報酬目安
- 4,200 ~ 4,600円/時
- 稼働時間目安
- 週5日 (時間目安 160時間)
- はたらく場所
- フルリモート
- スキル
【フルリモート/週5】Pythonデータエンジニア(大規模データ基盤構築・ETLパイプライン設計)
お任せしたいこと
自社サービスから日々生み出されるテラバイト・ペタバイト級の膨大なデータを、ビジネスサイドやデータサイエンティストが「いつでも・正確に・安全に」活用できるようにするための、大規模データ基盤(データレイク・データウェアハウス)およびETL/ELTパイプラインの設計・構築・運用をお任せします。
「とりあえずcronでPythonスクリプトを定期実行してDWHにデータを流し込む」ような、運用保守の限界がすぐに訪れる属人的なバッチ処理から脱却し、冪等性(何度実行しても同じ結果になること)やデータガバナンスを担保した、スケーラブルで堅牢なデータパイプラインを泥臭く作り上げていくポジションです。
具体的な業務内容
・Pythonを用いた、各種APIや外部システム、社内データベースからのデータ抽出(Extract)および複雑な加工・変換(Transform)処理の設計と実装
・Apache Airflow、Dagster、Prefect等を利用した、依存関係の複雑なデータパイプライン(ワークフロー)のオーケストレーションと自動化
・BigQuery、Snowflake、またはAmazon Redshift等を利用した、分析用途に最適化されたデータウェアハウス(DWH)およびデータマートのテーブル設計・構築
・dbt(data build tool)等を導入・活用した、SQLによるデータ変換処理のコード化、テスト自動化、およびリネージ(データの系譜)管理
・データ品質(Data Quality)を担保するための、異常値や欠損値の自動検知アラート機能の実装
・パブリッククラウド(GCP, AWS)上の各種データ連携サービス(Pub/Sub, Kinesis, Dataflow等)を活用した、リアルタイムデータストリーミング基盤の検証・構築
・バックエンドエンジニアやデータサイエンティストと連携した、ログ設計の標準化(トラッキングスキーマの定義)および上流の仕様変更に伴うパイプラインの追従
必須スキル・経験
・Pythonを用いた実務での開発経験(目安として3年以上)
・RDBMSやデータウェアハウスにおける、複雑で高度なSQL(Window関数等)を用いたデータ処理経験
・クラウド環境(GCP, AWSのいずれか)における、データパイプラインまたはバックエンドAPIの構築経験
・Git / GitHubを用いた構成管理、およびプルリクエストベースでのチーム開発経験
歓迎スキル・経験
・データエンジニアとしての実務経験、またはデータ基盤の立ち上げ経験
・Apache Airflow等のワークフローエンジンを用いたタスクオーケストレーション経験
・BigQuery、Snowflake、Redshift等のモダンなデータウェアハウス(MDW)の運用・チューニング経験
・dbtを用いたデータモデリング、およびデータパイプラインのCI/CD構築経験
・Apache Spark等の分散処理フレームワーク、またはKafka等を用いたストリーミング処理の経験
開発・業務環境
開発言語:Python 3.x, SQL
データウェアハウス:Google BigQuery (または Snowflake, Amazon Redshift)
ワークフローエンジン:Apache Airflow (または Dagster, Prefect)
データ変換・管理:dbt
クラウド・インフラ:GCP, AWS, Docker
テスト・CI/CD:pytest, GitHub Actions
コミュニケーション・管理:GitHub, Jira, Slack, Zoom
プロジェクトチームについて
データ基盤(データエンジニアリング)チームへの配属となります。
「Garbage In, Garbage Out(ゴミを入れればゴミが出てくる)」という言葉を重く受け止め、分析結果の精度を根底から支える「データの品質」に最も価値を置くカルチャーです。上流のアプリケーションエンジニアが勝手にDBのカラム定義を変更してパイプラインが壊れた際にも、ただ文句を言うのではなく、「どうすればスキーマの変更をCIで検知し、データチームに事前に通知できるか」という仕組みによる解決を泥臭く追求しています。
求める人物像
・華やかなAIモデルの開発よりも、その前提となる「綺麗なデータが毎日決まった時間に確実に揃っている状態」を作るための、配管工(プラミング)のような泥臭い作業に誇りを持てる方
・「とりあえず動くSQL」で満足せず、処理コスト(スキャン量)や実行時間を最小限に抑えるためのクエリチューニングにパズルを解くような楽しさを見出せる方
・インフラ、バックエンド、データサイエンスの領域を横断し、異なる言語を話す各チームと粘り強く仕様の調整ができる方
仕事の魅力
企業の「データドリブンな意思決定」という言葉は、強固なデータ基盤なしには実現しません。ペタバイト級のデータトラフィックを捌き、社内のあらゆる部署が活用する「データの民主化」をインフラの最下層から牽引する経験は、エンジニアとして極めて影響力が大きく、AI活用が一般化するこれからの時代において最も希少で市場価値の高い「データエンジニア」としての確固たるキャリアを築くことができます。
働き方
リモート環境
[フルリモート] 基本的にフルリモートで働いていただけます。
株式会社Kaizen Tech Agent
株式会社Kaizen Tech Agentは、「人と技術をつなぐ」ことを企業理念に掲げ、日々向上していく『技術』と『人』を最適な形でむつび付け提供することで、
お客様にとって真にプラスとなる価値でありたいと考えております。
私たちはそれぞれの個性を尊重し、ほっとする和みの社風でありながら、変化する時代に対して受け身にならず、未来への挑戦心を宿しています。
事業領域は、WEBアプリ開発、業務システム開発、スマホアプリ開発、インフラ構築など幅広く展開しており、
フリーランス様に対して最適な案件をご提案させて頂いております。どんな些細な事でも結構ですので是非いつでもお気軽にご相談ください。
