Responsibilities
- Create and manage Grafana dashboards and telemetry visualizations to track system performance, latency, error rates, saturation, and platform health metrics.
- Set up and oversee observability tools such as Prometheus, ensuring effective monitoring and alerting for critical services and SRE Golden Signals.
- Build, validate, and sustain modular Ansible playbooks for automating infrastructure deployment, application configuration, patching, and operational tasks.
- Enable enterprise-level automation using AWX by managing centralized job execution, automation templates, role-based access control, and reusable workflows.
- Manage Infrastructure as Code repositories in Git, adhering to version control standards, peer review processes, and CI/CD integration.
- Engage in Agile rituals like Sprint Planning, Daily Stand-ups, Backlog Refinement, and Retrospectives to support sprint delivery and continuous process improvement.
- Work closely with Product Owners, Scrum Masters, and development teams to convert business needs into technical user stories and advance automation, monitoring, and reliability efforts.