エンジニアフルリモート

【フルリモート/週5】AWS データアーキテクト・データエンジニア(ペタバイト級データレイク基盤構築とリアルタイム分散処理)

【フルリモート/週5】AWS データアーキテクト・データエンジニア(ペタバイト級データレイク基盤構築とリアルタイム分散処理)

案件要件

職種
エンジニア
業務内容
システム開発・運用
SES
報酬目安
4,700 ~ 5,100円/時
稼働時間目安
週5日 (時間目安 160時間)
はたらく場所
フルリモート
スキル

【フルリモート/週5】AWS データアーキテクト・データエンジニア(ペタバイト級データレイク基盤構築とリアルタイム分散処理)

お任せしたいこと

自社で展開する急成長中の大規模Webサービス、または膨大なトランザクションを抱えるエンタープライズ領域において、企業内に散在するサイロ化されたデータを統合し、ビジネスの意思決定や機械学習モデルの精度向上を根底から支える、AWSのマネージドサービスを中心とした「モダンデータスタック」の設計・構築をお任せします。
「とりあえずAmazon S3にログを投げ込んでおくだけ(データスワンプ化)」や「誰が作ったか分からない野良バッチ処理によるデータの欠損」といった技術的負債を徹底的に排除し、Amazon KinesisやAWS Glue、Amazon Redshiftを駆使して、リアルタイム性とデータの信頼性(Data Quality)を泥臭く両立させる、スケーラブルなデータ分析基盤を牽引していただく中核的なポジションです。

具体的な業務内容

・Amazon S3をデータレイクの中心に据え、AWS Glue(PySpark)やAmazon EMRを利用した、テラバイト〜ペタバイト級の大規模ETL / ELTパイプラインの設計と実装
・Amazon Kinesis Data Streams / Data Firehose、または Amazon MSK(Managed Streaming for Apache Kafka)を活用した、リアルタイムなストリーミングデータ収集基盤の構築
・Amazon Redshift、または Amazon Athena等のDWH/クエリエンジンにおける、泥臭いパーティション設計、カラムナフォーマット(Parquet等)の最適化、および複雑な分析クエリのチューニング
・Amazon MWAA(Managed Workflows for Apache Airflow)やAWS Step Functionsを利用した、複雑な依存関係を持つデータパイプラインのオーケストレーションと冪等性(Idempotency)の担保
・AWS Lake Formationを用いた、細粒度なアクセスコントロール(列・行レベルセキュリティ)と、データガバナンス・データカタログの全社的な統制
・dbt(data build tool)等を活用したデータ変換処理のコード化、およびデータリネージ(データの来歴)の可視化とテスト自動化
・AWS CDK または Terraformを利用したデータインフラストラクチャの完全なコード化(IaC)と、CI/CDパイプラインを通じた安全なデプロイメント
・FinOpsの観点に基づく、Athenaのフルスキャンクエリの撲滅や、RedshiftのRA3ノード等のコスト最適化に向けた泥臭いアーキテクチャ改善

必須スキル・経験

・AWSを利用したデータ分析基盤(データレイク、DWH等)の設計・構築・運用実務経験(目安として3年以上)
・Python、または Scala 等を用いた複雑なデータ処理スクリプトの実装経験
・RDBMSおよび分散クエリエンジンにおける、高度なSQLの記述力とパフォーマンスチューニング経験
・Apache Airflow等のワークフローオーケストレーションツールを用いたETLパイプラインの構築経験
・Git / GitHubを用いたチーム開発経験、およびInfrastructure as Code (IaC) の運用経験

歓迎スキル・経験

・AWS Glue、EMR等における Apache Sparkを用いた大規模分散処理エンジニアリング経験
・Snowflake、Databricks、BigQuery等のモダンなデータプラットフォームの運用経験
・dbtを用いたデータモデリング、およびデータパイプラインへのテスト導入経験
・リアルタイム・ストリーミング処理(Kafka, Kinesis, Flink等)のアーキテクチャ設計経験
・AWS Certified Data Engineer - Associate、または Data Analytics - Specialty などの資格

開発・業務環境

クラウド・インフラ:AWS (S3, Glue, Athena, Redshift, Kinesis, MWAA, Step Functions, Lake Formation 等)
データ処理・変換:Python, PySpark, SQL, dbt
オーケストレーション:Apache Airflow (Amazon MWAA)
IaC・構成管理:Terraform (または AWS CDK)
監視・可観測性:Datadog, Amazon CloudWatch, AWS X-Ray
コミュニケーション・管理:GitHub, Jira, Slack, Zoom

プロジェクトチームについて

「データサイエンティストがモデル開発に集中でき、ビジネスサイドが迷いなく意思決定できるクリーンなデータを届けること」を至上命題とする、データプラットフォームチームへの配属となります。
「分析基盤の数字が本番データベースと合わない」というデータエンジニアリング最大の恥辱を極めて嫌い、上流のマイクロサービスから飛んでくるスキーマ変更や欠損データに対して、下流のパイプラインが壊れないような堅牢なデッドレターキュー(DLQ)やリトライ機構を泥臭く設計する手堅いカルチャーです。ダッシュボードの表示が遅いと報告された際にも、単にDWHのリソースを増やすのではなく、クエリの実行計画やS3のオブジェクトサイズまで泥臭くプロファイリングし、根本からアーキテクチャを正す実直なメンバーが集まっています。

求める人物像

・「ただ新しいツールを導入すること」以上に、「データの鮮度、正確性、そしてセキュリティのバランスを保ち、実質的なビジネス価値を生み出すこと」にエンジニアとしての美学を持てる方
・複雑に絡み合ったスパゲッティSQLや、属人化したバッチ処理の解読から逃げず、パズルを解くようにモダンなデータスタックへとリファクタリングを楽しめる方
・アプリケーションエンジニア(データソース側)とデータアナリスト(データ利用者側)の両方の言語を理解し、サイロ化しがちな組織の橋渡し役を担える方

仕事の魅力

AIや機械学習のビジネス活用が当たり前となった現代において、その心臓部である「データ基盤」の信頼性とスケーラビリティは企業の命運を握っています。ペタバイト級のデータトラフィックと複雑な分散システム基盤をAWSの最先端サービスで構築・統制する泥臭い経験を通じて、単なる「インフラエンジニア」や「バックエンドエンジニア」の枠を完全に凌駕し、AI時代において最も渇望され高額なオファーが飛び交う「シニアデータエンジニア・データアーキテクト」としての圧倒的な市場価値を築くことができます。

働き方

リモート環境

[フルリモート] 基本的にフルリモートで働いていただけます。


SNSでこの案件をシェア

株式会社Kaizen Tech Agent

株式会社Kaizen Tech Agent

株式会社Kaizen Tech Agentは、「人と技術をつなぐ」ことを企業理念に掲げ、日々向上していく『技術』と『人』を最適な形でむつび付け提供することで、
お客様にとって真にプラスとなる価値でありたいと考えております。
私たちはそれぞれの個性を尊重し、ほっとする和みの社風でありながら、変化する時代に対して受け身にならず、未来への挑戦心を宿しています。
事業領域は、WEBアプリ開発、業務システム開発、スマホアプリ開発、インフラ構築など幅広く展開しており、
フリーランス様に対して最適な案件をご提案させて頂いております。どんな些細な事でも結構ですので是非いつでもお気軽にご相談ください。

案件を公開しました

案件をシェアしませんか?(SNSシェアをすることで、求職者の応募数アップが期待できます。)

案件を公開しました

この案件は限定公開です。案件のURLを知っている人のみが案件情報を見ることができます。

応募が完了しました

アピールしたいポイントがあれば積極的にメッセージを送ってみましょう。