Responsibilities
Design, deploy, maintain, and upgrade enterprise-scale observability infrastructure across development, QA, UAT, production, and disaster recovery environments. Manage deployments using GitOps and infrastructure as code, implement long-term metrics storage with cloud object storage, and configure distributed architectures across datacenters and cloud providers.
Requirements
The role calls for mid-senior-level experience with enterprise observability systems and tools such as Prometheus, Grafana, Thanos, and Loki. It also involves GitOps, infrastructure as code, cloud object storage, and operating observability systems across multiple environments, datacenters, and cloud providers.