エンジニアフルリモート

【フルリモート/週5】AWS SRE(Site Reliability Engineer)(大規模トラフィックの信頼性向上とEKSコンテナ基盤運用)

【フルリモート/週5】AWS SRE(Site Reliability Engineer)(大規模トラフィックの信頼性向上とEKSコンテナ基盤運用)

案件要件

職種
エンジニア
業務内容
システム開発・運用
SES
報酬目安
4,700 ~ 5,400円/時
稼働時間目安
週5日 (時間目安 160時間)
はたらく場所
フルリモート
スキル

【フルリモート/週5】AWS SRE(Site Reliability Engineer)(大規模トラフィックの信頼性向上とEKSコンテナ基盤運用)

お任せしたいこと

自社で展開する月間数億PVを超える大規模Webサービス、または急成長中のBtoB SaaSにおいて、システムの信頼性(Reliability)をソフトウェアエンジニアリングのアプローチで継続的に向上させるSRE(Site Reliability Engineering)業務をお任せします。
「インフラのお守り(手作業での運用保守)」を極端に嫌い、SLI/SLO(サービスレベル指標/目標)に基づいたデータドリブンな意思決定を行いながら、Amazon EKSを中心としたコンテナ基盤のスケールアップ、およびトイル(Toil:無価値な手作業)の徹底的な自動化を泥臭く推進していただくポジションです。

具体的な業務内容

・ビジネスサイド(PdM等)と連携した、ユーザージャーニーに基づく適切なSLI(サービスレベル指標)の定義、およびSLO(サービスレベル目標)の策定と運用
・Amazon EKS(Kubernetes)を活用した、高可用かつスケーラブルなマイクロサービス・コンテナオーケストレーション基盤の設計・構築・運用
・Terraformを利用したインフラストラクチャの完全なコード化(IaC)、およびGitHub ActionsやArgoCDを用いたGitOpsによるデプロイメントパイプラインの構築
・Datadog、New Relic、またはPrometheus/Grafanaを利用した、分散システム全体の可観測性(Observability)向上とプロアクティブなアラート設計
・本番環境における大規模障害発生時のインシデントコマンダー(指揮)、および非難を伴わないポストモーテム(Blameless Post-mortem)を通じた根本原因の排除
・AWS Cost ExplorerやCUR(Cost and Usage Report)を活用した、クラウドリソースのキャパシティプランニングおよびFinOps(クラウドコスト最適化)の泥臭い実践
・Go、Python、またはBashを用いた、運用オペレーション(トイル)を自動化するための社内ツールやCLIの開発

必須スキル・経験

・AWSを利用した大規模Webサービスのインフラ設計、構築、および本番環境での運用実務経験(目安として3年以上)
・Terraform、AWS CDK等を用いたIaC(Infrastructure as Code)の実践経験
・Docker、およびKubernetes(Amazon EKS等)を利用したコンテナ環境の構築・運用経験
・Go、Python、Rubyなどのプログラミング言語を用いた、自動化スクリプトやツールの開発経験
・Git / GitHubを用いた構成管理、およびプルリクエストベースでのチーム開発経験

歓迎スキル・経験

・SREとしての実務経験、およびSLI/SLOの導入・運用をリードした経験
・DatadogやNew Relic等のAPMツールを利用した、分散トレーシングおよびパフォーマンスチューニングの高度な実践経験
・カオスエンジニアリング(Chaos Engineering)の導入、またはゲームデー(GameDay)の実施経験
・FinOpsの実践(リザーブドインスタンス/Savings Plansの適切な運用、スポットインスタンスの活用等)による大幅なコスト削減経験
・AWS Certified DevOps Engineer - Professional、または CKA(Certified Kubernetes Administrator)等の資格

開発・業務環境

クラウド・インフラ:AWS (EKS, EC2, RDS, ElastiCache, S3, Route53, CloudFront 等)
IaC・構成管理:Terraform
コンテナ技術:Docker, Kubernetes (Amazon EKS)
CI/CD:GitHub Actions, ArgoCD
自動化・ツール開発言語:Go, Python
監視・可観測性:Datadog, Prometheus, Grafana
インシデント管理:PagerDuty, Jira
コミュニケーション・管理:GitHub, Notion, Slack, Zoom

プロジェクトチームについて

システムの安定稼働とスケーラビリティを担保するSREチームへの配属となります。
「障害ゼロ」という非現実的な目標を追うのではなく、「エラーバジェット(失敗を許容する予算)」の概念を組織全体に浸透させ、機能開発のスピードとシステムの信頼性のバランスを論理的にコントロールする手堅いカルチャーです。夜間にアラートが鳴った際には、「誰がミスをしたか」ではなく「なぜシステムがミスを防げなかったのか」という仕組みの欠陥に目を向け、二度と同じアラートでエンジニアが起こされないためのフェイルセーフを泥臭く実装しています。

求める人物像

・「同じ手作業を二度繰り返すこと」に強い苦痛を感じ、自らコードを書いて運用プロセスを自動化することにエンジニアとしての執念を持てる方
・突発的なシステムダウンや高負荷状態に直面した際、パニックに陥ることなく、メトリクスとログから冷静に事実を切り分け、論理的にトラブルシューティングができる方
・「インフラを管理する人」という枠に閉じこもらず、アプリケーションエンジニアと対等にコードレベルでのパフォーマンス改善の議論ができる方

仕事の魅力

数百万〜数千万のユーザートラフィックと、膨大なトランザクションを捌くミッションクリティカルなシステムにおいて、AWSのエコシステムとKubernetesのポテンシャルを限界まで引き出す極めて難易度が高くやりがいのあるポジションです。ソフトウェアエンジニアリングの手法を用いてインフラと組織の信頼性をスケールさせる経験を通じて、現代のテック業界で最も枯渇し、高い報酬で迎えられる「SREアーキテクト」としての圧倒的な市場価値を築くことができます。

働き方

リモート環境

[フルリモート] 基本的にフルリモートで働いていただけます(※大規模障害発生時の緊急インシデント対応や、SLOの見直しに関するPdM・テックリードとのすり合わせにおいて、密な同期コミュニケーションが突発的に発生します)。


SNSでこの案件をシェア

株式会社Kaizen Tech Agent

株式会社Kaizen Tech Agent

株式会社Kaizen Tech Agentは、「人と技術をつなぐ」ことを企業理念に掲げ、日々向上していく『技術』と『人』を最適な形でむつび付け提供することで、
お客様にとって真にプラスとなる価値でありたいと考えております。
私たちはそれぞれの個性を尊重し、ほっとする和みの社風でありながら、変化する時代に対して受け身にならず、未来への挑戦心を宿しています。
事業領域は、WEBアプリ開発、業務システム開発、スマホアプリ開発、インフラ構築など幅広く展開しており、
フリーランス様に対して最適な案件をご提案させて頂いております。どんな些細な事でも結構ですので是非いつでもお気軽にご相談ください。

案件を公開しました

案件をシェアしませんか?(SNSシェアをすることで、求職者の応募数アップが期待できます。)

案件を公開しました

この案件は限定公開です。案件のURLを知っている人のみが案件情報を見ることができます。

応募が完了しました

アピールしたいポイントがあれば積極的にメッセージを送ってみましょう。