【フルリモート/週5】AWSデータエンジニア(大規模データ分析基盤・リアルタイムパイプライン構築) お任せしたいこと 自社で展開する大規模プロダクト群、または全社横断のデータ活用を支えるため、AWSのフルマネージドサービス(S3, Glue, Redshift, Athena等)を駆使したモダンでスケーラブルなデータレイクおよびデータウェアハウス(DWH)の設計・構築をお任せします。 「とりあえずデータを一箇所に溜め込むだけ」の使われないデータスワンプ(沼)を作るのではなく、データの鮮度・品質・ガバナンスを担保しながら、経営層の意思決定(BI)からデータサイエンティストの機械学習(ML)モデル学習まで、全社のデータ活用を根底から支える堅牢なデータパイプラインを泥臭く作り上げていくポジションです。 具体的な業務内容 ・AWS Glue(PySpark)、AWS Step Functions、またはAmazon MWAA(Managed Workflows for Apache Airflow)を利用した、大規模かつ複雑なETL/ELTパイプラインの設計・開発 ・Amazon Kinesis Data Streams、またはAmazon MSK(Kafka)を活用した、リアルタイム(ストリーミング)データパイプラインの構築 ・Amazon S3をベースとしたデータレイク層と、Amazon Redshift(または Snowflake)を用いたデータウェアハウス・データマート層の最適なアーキテクチャ設計 ・PythonおよびSQLを用いた、非構造化・半構造化データ(JSON, ログ等)のクレンジング、正規化、およびdbtを利用したデータモデリングの実装 ・AWS Lake FormationやIAMを活用した、機密データ(PII等)に対する厳密なアクセス制御とデータガバナンスの仕組み作り ・Terraform、またはAWS CDKを用いたインフラのコード化(IaC)、およびGitHub Actions等によるデータ基盤のCI/CD自動化 ・DatadogやAWS CloudWatchを用いた、データ遅延やジョブ失敗時のプロアクティブな監視・アラート設計とトラブルシューティング 必須スキル・経験 ・データエンジニア、またはバックエンドエンジニアとしての実務経験(目安として3年以上) ・AWSのデータ関連サービス(S3, Glue, Redshift, Athena, Kinesis等)を用いたインフラ設計・構築経験 ・Python、またはScala等を用いたデータ処理プログラムの開発経験 ・複雑なSQLクエリの作成、およびRDBMS/DWHにおけるパフォーマンスチューニングの実務経験 ・Terraform、またはAWS CDK等を用いたIaC(Infrastructure as Code)の実践経験 歓迎スキル・経験 ・Apache Airflow(MWAA)、またはPrefect等を用いた複雑なワークフロー(DAG)の設計・運用経験 ・dbt(data build tool)を用いたアナリティクスエンジニアリングの実務経験 ・分散処理フレームワーク(Apache Spark, Hadoop等)を用いたペタバイト級のデータ処理経験 ・BIツール(Tableau, Amazon QuickSight, Looker等)を用いたデータ可視化、またはダッシュボード構築経験 ・AWS Certified Data Engineer - Associate、または Solutions Architect - Professional 等の資格 開発・業務環境 クラウド・インフラ:AWS (S3, Redshift, Glue, Athena, Kinesis, MSK, Step Functions, MWAA 等) データ処理・言語:Python (PySpark), SQL, Scala パイプライン・変換:dbt, Apache Airflow IaC・構成管理:Terraform (または AWS CDK) 監視・可観測性:Datadog, Amazon CloudWatch コミュニケーション・管理:GitHub, Jira, Slack, Zoom プロジェクトチームについて 全社のデータドリブン経営の心臓部を担う、データプラットフォーム(データ基盤)チームへの配属となります。 「Garbage in, garbage out(ゴミを入れればゴミが出てくる)」という原則を深く理解しており、上流システムの仕様変更によるパイプラインの破損に対しても感情的にならず、データコントラクト(取り決め)の導入や自動テスト(Great Expectations等)を通じてデータの品質を仕組みで守る手堅いカルチャーです。バッチ処理の失敗時には、冪等性(Idempotency)を担保したジョブ設計により、泥臭くとも確実にデータを再処理して欠損を防ぐ実直なメンバーが集まっています。 求める人物像 ・「最新のデータツールを使うこと」自体を目的とせず、「そのデータがビジネス課題をどう解決するか」という価値提供に圧倒的な当事者意識を持てる方 ・混沌とした非構造化データや、レガシーシステムから吐き出される汚いログデータに直面しても、パズルを解くようにデータクレンジングを楽しめる方 ・インフラ、バックエンドアプリケーション、データ分析の境界線を自ら越境し、フルスタックにアーキテクチャ全体を俯瞰できる好奇心を持った方 仕事の魅力 LLMの台頭やAI活用の本格化に伴い、「良質な独自のデータ」をどれだけ迅速に提供できるかが企業の競争優位性を直接決定する時代において、その中核となるシステムを最前線で構築する極めて重要度の高いポジションです。膨大なトラフィックと複雑な要件が絡み合うデータエコシステムをAWS上で最適化する経験を通じて、メガベンチャーからエンタープライズまであらゆる企業が喉から手が出るほど欲しがる「トップクラスのAWSデータアーキテクト」としての圧倒的な市場価値を築くことができます。 働き方 リモート環境 [フルリモート] 基本的にフルリモートで働いていただけます。