エンジニアフルリモート

【フルリモート/週5】AWS データレイク・アーキテクト(ペタバイト級の大規模データ統合とリアルタイム分析基盤の極限追求)

【フルリモート/週5】AWS データレイク・アーキテクト(ペタバイト級の大規模データ統合とリアルタイム分析基盤の極限追求)

案件要件

職種
エンジニア
業務内容
システム開発・運用
SES
報酬目安
4,400 ~ 4,800円/時
稼働時間目安
週5日 (時間目安 160時間)
はたらく場所
フルリモート
スキル

【フルリモート/週5】AWS データレイク・アーキテクト(ペタバイト級の大規模データ統合とリアルタイム分析基盤の極限追求)

お任せしたいこと

自社で展開する数千万ユーザーの行動ログを抱える大規模プラットフォーム、または全社的なデジタルトランスフォーメーション(DX)を推進する巨大エンタープライズ環境において、AWSのアナリティクスサービス群(Amazon S3, AWS Glue, Amazon Redshift等)を極限まで使い倒し、組織のサイロ化されたデータを一元管理する「モダン・データレイク/データウェアハウス基盤」の設計・構築をお任せします。
「誰が管理しているか分からない野良のバッチ処理」や「クエリを叩くたびに数十分待たされる非効率なデータマート」といった技術的負債を徹底的に排除し、AWS Lake Formationによる厳格なガバナンス統制から、Amazon Kinesisを利用したミリ秒単位のストリーミング処理までを泥臭く牽引することで、データサイエンティストやビジネス部門が「真のインサイト」に爆速でアクセスできる最強のデータ基盤を作り上げる中核的なポジションです。

具体的な業務内容

・Amazon S3を中心としたペタバイト級のデータレイク・アーキテクチャの設計と、ParquetやORC等の列指向(カラムナー)フォーマットを利用したストレージ・I/Oの極限の最適化
・AWS Glue(Apache Spark)や Amazon EMRを活用した、テラバイト単位のデータを処理するスケーラブルなETL/ELTパイプラインの泥臭い設計とパフォーマンスチューニング
・Amazon Redshift(RA3ノード)を利用した大規模データウェアハウスの構築、および Redshift Spectrum を活用したS3上のデータに対するシームレスなクエリフェデレーション
・Amazon Kinesis Data Streams / Firehose、または Amazon MSK(Managed Streaming for Apache Kafka)を利用した、リアルタイムデータのストリーミング収集・処理基盤の実装
・AWS Lake Formation を用いた、データベース・テーブル・カラム(列)および行レベルでの厳格なアクセス制御(Fine-Grained Access Control)と全社データガバナンスの仕組み化
・Amazon Athena におけるクエリ実行計画の泥臭いプロファイリングと、パーティション設計・インデックス最適化によるスキャンコスト(FinOps)の劇的な削減
・Amazon Managed Workflows for Apache Airflow (MWAA) や AWS Step Functions を利用した、数百の依存関係が絡み合う複雑なデータパイプラインのオーケストレーション
・Terraform または AWS CDK を用いた、データインフラストラクチャの完全なコード化(IaC)とCI/CDによるデプロイ自動化

必須スキル・経験

・AWS環境におけるシステムインフラ、またはデータ基盤の設計・構築・運用実務経験(目安として4年以上)
・Amazon S3、AWS Glue、Amazon Redshift、Athena等のAWSアナリティクスサービスの深い知識と実務での運用経験
・Python、または Scala 等を用いた大規模なデータ処理プログラム(Spark等)の開発経験
・高度なSQLの記述力、および分散クエリエンジン(Presto / Trino等)やRDBMSにおける泥臭いクエリチューニング経験
・Terraform、またはAWS CDKを用いたIaC(Infrastructure as Code)の実践経験

歓迎スキル・経験

・AWS Certified Data Engineer - Associate、または AWS Certified Data Analytics - Specialty などの資格
・AWS Lake Formationを用いたエンタープライズ規模のデータガバナンス・セキュリティ設計経験
・Apache Airflow(MWAA)等を用いた複雑なワークフローパイプラインの構築経験
・Data Mesh(データメッシュ)やData Fabricの概念に基づく、ドメイン駆動型のデータアーキテクチャ導入経験
・Amazon QuickSight、Tableau等のBIツールとのインテグレーション経験

開発・業務環境

クラウド・データ基盤:AWS (S3, Glue, Redshift, Athena, Kinesis, EMR, Lake Formation)
開発言語・フレームワーク:Python, SQL, PySpark, Scala
オーケストレーション:Amazon MWAA (Apache Airflow), AWS Step Functions
IaC・構成管理:Terraform (または AWS CDK)
BIツール・可視化:Amazon QuickSight, Tableau, Redash
コミュニケーション・管理:GitHub, Jira, Slack, Zoom

プロジェクトチームについて

「データは単なるログの塊ではなく、ビジネスの意思決定を左右するプロダクトそのものである(Data as a Product)」と確信し、データの鮮度と品質に狂気にも似た執念を燃やすデータプラットフォーム専門チームへの配属となります。
「分析ダッシュボードの数字が合わない」というデータ基盤最大の恥辱を極めて嫌い、上流システムの予期せぬスキーマ変更に対してもパイプラインが強靭に耐えうるよう、データカタログの自動更新やデッドレターキューを泥臭く設計する手堅いカルチャーです。Glueのジョブが突然OOM(Out of Memory)でクラッシュした際にも、単にDPU(リソース)を増やすのではなく、Sparkのシャッフル処理やデータスキュー(偏り)を論理的にプロファイリングし、パズルを解き明かす実直なメンバーが集まっています。

求める人物像

・「言われたデータをS3にコピーするだけのパイプライン屋」ではなく、分散処理の裏側(メモリ管理やネットワークI/O)をハックし、コンピュートコストとパフォーマンスの極限のトレードオフを泥臭く調整することにエンジニアとしての美学を持てる方
・社内に散在するスパゲッティ状態のバッチスクリプトに対して文句を言うのではなく、それらをAWSのモダンなマネージドサービスへと美しくリファクタリングする過程を楽しめる方
・機械学習(AI)やBIの裏側にある「データのサイロ化」という組織的な課題に立ち向かい、技術の力で全社にデータを民主化していくことに強い当事者意識を持った方

仕事の魅力

生成AIや高度な機械学習をビジネスに実装する上で、その源泉となる「クリーンでスケーラブルなデータレイク」の構築はすべての企業の最重要課題となっています。ペタバイト級のデータが流れ込む巨大なインフラをAWSの最先端のアナリティクスサービス群で泥臭く統制する経験を通じて、単なる「データエンジニア」を完全に凌駕し、世界中のメガベンチャーやエンタープライズ企業が最も高額な条件で渇望する「シニア AWS データレイク・アーキテクト」としての圧倒的な市場価値を築くことができます。

働き方

リモート環境

[フルリモート] 基本的にフルリモートで働いていただけます。


SNSでこの案件をシェア

株式会社Kaizen Tech Agent

株式会社Kaizen Tech Agent

株式会社Kaizen Tech Agentは、「人と技術をつなぐ」ことを企業理念に掲げ、日々向上していく『技術』と『人』を最適な形でむつび付け提供することで、
お客様にとって真にプラスとなる価値でありたいと考えております。
私たちはそれぞれの個性を尊重し、ほっとする和みの社風でありながら、変化する時代に対して受け身にならず、未来への挑戦心を宿しています。
事業領域は、WEBアプリ開発、業務システム開発、スマホアプリ開発、インフラ構築など幅広く展開しており、
フリーランス様に対して最適な案件をご提案させて頂いております。どんな些細な事でも結構ですので是非いつでもお気軽にご相談ください。

案件を公開しました

案件をシェアしませんか?(SNSシェアをすることで、求職者の応募数アップが期待できます。)

案件を公開しました

この案件は限定公開です。案件のURLを知っている人のみが案件情報を見ることができます。

応募が完了しました

アピールしたいポイントがあれば積極的にメッセージを送ってみましょう。