【フルリモート/週5】AWS SRE・プラットフォームアーキテクト(EKS大規模クラスターの完全統制とPlatform Engineeringの極限追求) お任せしたいこと 自社で展開する数百のマイクロサービスが稼働する大規模プラットフォーム、または急激なトラフィック増を抱える急成長SaaSにおいて、開発組織全体の生産性を底上げする「Platform Engineering」の推進と、システムの信頼性を極限まで高める「SRE(Site Reliability Engineering)」をAWSインフラ上で牽引していただく中核的なポジションです。 「とりあえずEC2にDockerを入れてコンテナ化と呼ぶ」ような表面的なモダナイズや、「障害が起きるたびに本番環境へSSH接続して手作業で再起動する(Toilの放置)」といったレガシーな運用を徹底的に排除し、Amazon EKS(Kubernetes)とGitOpsを駆使した堅牢な基盤構築から、開発者がインフラを意識せずにコードのデプロイに集中できる「内部開発者プラットフォーム(IDP)」の泥臭い設計までを完遂することで、インフラストラクチャを「ビジネスを加速させる最強の武器」へと昇華させます。 具体的な業務内容 ・Amazon EKS(Elastic Kubernetes Service)を中心とした、数百ノード規模のマルチテナント・クラスターのアーキテクチャ設計、およびKarpenter等を用いたオートスケーリングの極限の最適化 ・Terraform、または AWS CDK を活用したインフラの完全なコード化(IaC)と、ArgoCD や Flux を用いた GitOps パターンによる宣言的で再現性のあるデプロイメント・パイプラインの泥臭い構築 ・Datadog、Prometheus、OpenTelemetryを利用した、分散システム全体にまたがる複雑なマイクロサービスの可観測性(Observability)の向上と、SLI/SLOに基づく厳格なアラート設計 ・Istio や AWS App Mesh 等のサービスメッシュを利用した、mTLSによるゼロトラストネットワークの実装、およびカナリアリリースやサーキットブレイカー等の高度なトラフィック制御 ・インシデント発生時の司令塔(インシデントコマンダー)としてのトリアージ対応と、障害の根本原因(Root Cause)をシステム的に排除するための非難なきポストモーテムの主導 ・カオスエンジニアリング(AWS Fault Injection Simulator等)の導入による、本番環境の予期せぬ障害(AZ障害やDBフェイルオーバー)に対するシステムの自己修復性(レジリエンス)の泥臭い検証 ・Go言語やPythonを用いた、Kubernetesのカスタムコントローラー(Custom Resource Definition: CRD)の実装や、開発者の認知負荷を下げるCLIツールの開発 ・AWSコスト配分タグやKubecostを利用した、クラスター単位・チーム単位でのインフラ原価の可視化と、FinOpsに基づく泥臭いリソース最適化 必須スキル・経験 ・AWSを利用した大規模インフラストラクチャの設計・構築・運用実務経験(目安として4年以上) ・Amazon EKS、または自前Kubernetesクラスターの本番環境での深い運用経験 ・Terraform、AWS CDK等を用いたIaCの実践、および CI/CDパイプラインの構築経験 ・Docker等のコンテナ技術、および Linux カーネルやネットワーク(TCP/IP, DNS等)に関する深いレイヤーの知識 ・Git / GitHubを用いたチーム開発経験、および SRE(Site Reliability Engineering)の基本原則に対する深い理解 歓迎スキル・経験 ・CKA(Certified Kubernetes Administrator)、または AWS Certified Solutions Architect - Professional などの資格 ・Go、Python等のプログラミング言語を用いた、自動化ツールやバックエンドAPIの開発経験 ・ArgoCD等を用いたGitOpsの本番導入・運用経験 ・Istio等のサービスメッシュ、または OpenTelemetryを用いた分散トレーシングの構築経験 ・Backstage等を利用した、内部開発者プラットフォーム(Internal Developer Portal)の立ち上げ経験 開発・業務環境 クラウド・コンテナ基盤:AWS (EKS, EC2, S3, Route53, VPC等), Kubernetes (Karpenter) IaC・GitOps:Terraform (または AWS CDK), ArgoCD, Helm, Kustomize 監視・可観測性:Datadog, Prometheus, Grafana, OpenTelemetry, AWS X-Ray 自動化・スクリプト:Go, Python, Bash, GitHub Actions サービスメッシュ・ネットワーク:Istio, AWS App Mesh, AWS Transit Gateway コミュニケーション・管理:GitHub, Jira, Slack, Zoom, PagerDuty (インシデント管理) プロジェクトチームについて 「インフラの障害は気合いと根性で直すのではなく、コードとアーキテクチャで未然に防ぐものである」と確信し、運用作業(Toil)の撲滅に狂気にも似た執念を燃やすSRE/プラットフォーム専門チームへの配属となります。 「サーバーが落ちたから再起動しました」という人間臭い報告を極めて嫌い、なぜ落ちたのか、なぜ監視で事前に検知できなかったのか、なぜ自己修復(Auto Healing)されなかったのかを泥臭くプロファイリングし、パズルを解き明かすようにシステムを改善していく手堅いカルチャーです。本番環境でメモリリークによるPodの連続クラッシュが発生した際にも、パニックにならずに冷静にOOMKillerのログとメトリクスを追いかけ、論理的にリミット設計を再調整する実直なメンバーが集まっています。 求める人物像 ・「言われた通りにサーバーを立てるだけのインフラ屋」ではなく、開発者がより速く、より安全に価値をデプロイできるための「プラットフォーム」をプロダクトとして設計することにエンジニアとしての美学を持てる方 ・手作業によるオペレーション(SSHやマネジメントコンソールからの手動変更)に対して強い拒否反応を示し、あらゆる操作をGitのコミットとして表現(GitOps化)する泥臭いプロセスを楽しめる方 ・Kubernetesやクラウドのブラックボックスな挙動に対して文句を言うのではなく、公式ドキュメントやソースコードを読み込み、知的好奇心を持って技術の深淵をハックできる方 仕事の魅力 ビジネスの成長速度がシステムのデプロイ速度に直結する現代において、「開発者の認知負荷を下げ、スケーラブルなインフラをコードで統制する(Platform Engineering)」という概念は、海外のテックジャイアントのみならず国内でも最重要課題となっています。複雑怪奇なマイクロサービス群をEKSと最先端のエコシステムで泥臭く統制する経験を通じて、単なる「インフラ保守担当」を完全に凌駕し、世界中のメガベンチャーが最も高額な条件で渇望する「シニア SRE / プラットフォームアーキテクト」としての圧倒的な市場価値を築くことができます。 働き方 リモート環境 [フルリモート] 基本的にフルリモートで働いていただけます。