【フルリモート/週5】AWSデータエンジニア(データ分析基盤構築・パイプライン設計) お任せしたいこと 自社プロダクトの成長、またはクライアント企業のデータドリブンな意思決定を支えるため、AWSを中心としたデータ分析基盤(データレイク・データウェアハウス)の設計・構築・運用をお任せします。 サイロ化したデータの統合から、アナリストやデータサイエンティストが活用しやすいデータマートの構築まで、大規模データを安全かつ効率的に処理するデータパイプライン全体を技術面からリードしていただくポジションです。 具体的な業務内容 ・AWS(S3, AWS Glue, Amazon Athena, Amazon Redshift等)を活用したデータ基盤のアーキテクチャ設計および構築 ・PythonやSQL、PySparkを用いたデータ抽出・加工・ロード(ETL/ELT)パイプラインの設計・開発 ・AWS Step FunctionsやApache Airflow等を用いたデータパイプラインのワークフロー管理・自動化 ・BIツール(Amazon QuickSight, Tableau, Looker等)と連携するためのデータマート設計およびクエリ最適化 ・TerraformやAWS CDKを用いたデータインフラのコード化(IaC)、およびCI/CDの推進 ・データガバナンス要件に基づく、IAM等を利用した適切なアクセス制御とセキュリティ対策の実施 ・データ量の増加に伴うパフォーマンス劣化の調査、およびAWSコストの最適化 必須スキル・経験 ・AWSを利用したシステム構築、またはデータ基盤の開発実務経験(目安として3年以上) ・Pythonおよび高度なSQLを用いたデータ処理、ETL/ELTパイプラインの開発経験 ・データウェアハウス(Redshift, BigQuery, Snowflake等)の基本概念の理解と利用経験 ・Terraform等のIaCツールを用いたインフラ管理経験 ・Git / GitHub等を用いたチーム開発経験 歓迎スキル・経験 ・Apache Airflow、AWS Step Functions等のワークフローエンジンを利用した運用経験 ・Apache Spark等を用いた大規模データ分散処理の実務経験 ・AWS Certified Data Engineer - Associate、または AWS Certified Data Analytics - Specialty などの関連資格 ・ストリーミングデータ処理(Amazon Kinesis, Kafka等)の設計・構築経験 ・データカタログ(AWS Glue Data Catalog等)を用いたメタデータ管理、データガバナンスの知見 開発・業務環境 クラウド・データ基盤:AWS (S3, Glue, Athena, Redshift, EMR, Kinesis, Lambda, Step Functions等) 開発言語:Python, SQL, PySpark ワークフロー:Apache Airflow, AWS Step Functions IaC・CI/CD:Terraform, AWS CDK, GitHub Actions BIツール:Amazon QuickSight, Tableau, Looker等 コミュニケーション・管理:GitHub, Jira, Slack, Zoom, Notion プロジェクトチームについて データサイエンティストや事業部門のアナリストと密に連携し、「データからいかにビジネス価値を最速で引き出すか」を技術で支えるチームです。 単に要件通りにデータを連携するだけでなく、拡張性、保守性、コスト効率のバランスを考慮したアーキテクチャを主体的に提案・構築するカルチャーを大切にしています。トイル(手作業)を嫌い、パイプラインの自動化やコード管理を徹底するエンジニアリング思考を重視する環境です。 求める人物像 ・データの裏側にあるビジネス課題を理解し、目的達成のために最適な技術アプローチを提案できる方 ・テラバイト〜ペタバイト級の大規模データを、安全かつ高速に処理するアーキテクチャ設計にやりがいを感じる方 ・データ利用者(アナリストやビジネスサイド)のニーズを汲み取り、円滑なコミュニケーションが取れる方 ・進化の早いデータエンジニアリング領域やAWSの最新アップデートに対して、継続的にキャッチアップできる方 働き方 リモート環境 [フルリモート] 基本的にフルリモートで働いていただけます。