運用で見てきた負荷の傾向や不具合の起き方を設計に活かし、設計・構築・運用を一貫して理解したうえで、障害を減らし、性能・可用性・運用性を継続的に改善できるエンジニアになりたい。
インフラエンジニアとして約3年5か月、Linux / AWSを中心としたマルチクラウド環境の運用・保守・構築に従事しています。アラート対応約2,050件、運用タスク約680件を担当してきました。 力を入れてきたのは、復旧で終わらせず、なぜ負荷が上がるのかをログとメトリクスから特定し、再発を減らすところまで持っていくことです。ロードアベレージ上昇が続いていた環境では、EFSのスループット上限(4MiB/s)への到達を原因として特定し、費用増の試算を提示して合意をいただいた上でプロビジョニングスループットへ変更しました。月約60件出ていたアラートが0件になっています(監視の閾値は変更していません)。ほかにも、php-fpmワーカーが起動直後の4倍以上のメモリを抱えたまま回収されずに残っていることを特定してpm.max_spare_servers / pm.max_requestsを見直した案件、期限切れセッション約86万件の蓄積によるDB〜Web間の帯域飽和を特定した案件などがあります。 こうした改善を重ねる中で、問題が起きてから直すだけでなく、運用で見てきた負荷の傾向や不具合の起き方を設計の段階から反映できれば、より安定した環境を作れると考えるようになりました。要件定義からインフラ全体を設計した実務経験はまだありません。ただ、性能・可用性・運用性を考える材料は実運用から多く得てきたので、それを設計の手順や成果物に落とし込めるようになりたいと考えています。 技術的にはAWSとKubernetesを軸に置いています。EKSクラスターのアップグレードは業務で担当しましたが、Terraformは業務外での個人検証(50プロジェクト超)が中心で、本番運用の経験はありません。今後はIaCをチーム開発・レビュー・CI/CDの中で使い、監視・自動化・SLOなども含めて、信頼性を仕組みから改善できる範囲を広げていきたいと考えています。
要望、不具合報告、使いづらい点や感想など、お気軽にお寄せください。
いただいたご意見は、今後のサービス向上に活用させていただきます。
なお、このフォームは受付専用のため、返信を行っておりません。
返信を希望する場合はお問い合わせよりご連絡ください。