Senior Technical Specialist
Teknik, data och digitalt · IT-infrastruktur och säkerhet · Site reliability engineering · DevOps
I korthet
HCLTech is seeking a Senior Technical Specialist in Hyderabad, Telangana, for an on-site, full-time role. The position focuses on Site Reliability Engineering (SRE) and operational excellence, particularly with Dynatrace, Kubernetes (GKE), Istio, and Kafka observability.
This role involves managing and improving observability platforms, ensuring system reliability, and contributing to cost management and knowledge transfer within engineering teams.
Ansvarsområden
- Administer Dynatrace Observability Platform
- Implement Observability Engineering (Metrics, Logs, Traces & Events)
- Manage OpenTelemetry Data Integration & Telemetry
- Define and maintain SLI/SLO Frameworks & Reliability Engineering practices
- Develop Alert Engineering & Incident Prevention strategies
- Ensure Cloud-Native SRE & Operational Excellence
- Oversee Incident Management & Problem Management Practices
- Develop Observability Automation & Self-Service Platform Engineering
- Govern Operational Resilience & Service Health
- Monitor Kubernetes (GKE) including containerized workloads, cluster health, performance, and troubleshooting
- Monitor Istio Service Mesh for service communication, dependency mapping, traffic observability, and operational insights
- Monitor Kafka for brokers, partitions, topics, consumer lag, throughput, failures, and resilience indicators
- Implement Cross-Team Service Journey Monitoring & Integration Visibility
- Monitor TM Vault services, dependencies, and operational health indicators (preferred)
- Monitor large-scale distributed systems, dependency mapping, and performance optimization (preferred)
- Manage FinOps, Cloud Cost Observability & Cost-to-Service Mapping (preferred)
- Utilize GCP Cost Management & Cloud Consumption Analytics (preferred)
- Develop training content, coaching, and drive observability adoption across engineering teams (preferred)
Krav
- Mandatory: Site Reliability Engineering (SRE) & Operational Excellence
- Mandatory: Dynatrace Observability Platform Administration
- Mandatory: Observability Engineering (Metrics, Logs, Traces & Events)
- Mandatory: OpenTelemetry Data Integration & Telemetry Management
- Mandatory: SLI/SLO Frameworks & Reliability Engineering
- Mandatory: Alert Engineering & Incident Prevention
- Mandatory: Cloud-Native SRE & Operational Excellence
- Mandatory: Incident Management & Problem Management Practices
- Mandatory: Observability Automation & Self-Service Platform Engineering
- Mandatory: Operational Resilience & Service Health Governance
- Mandatory: Kubernetes (GKE) Observability & Platform Monitoring
- Mandatory: Istio Service Mesh Monitoring & Service Dependency Visibility
- Mandatory: Kafka Monitoring & Event Platform Observability
- Mandatory: Cross-Team Service Journey Monitoring & Integration Visibility
- Preferred: TM Vault Observability & Platform Operations
- Preferred: Distributed Systems Observability & Performance Engineering
- Preferred: FinOps, Cloud (GCP) Cost Management
- Preferred: Training, Enablement & Knowledge Transfer
Förmåner
- Supercharge your potential
- Find your career
- Find your spark
- A place that knows that helping its customers stay on top starts by putting its people first
- Work at a global technology company
- Be part of an organization with over 223,000 people across 60 countries
- Deliver industry-leading capabilities centered around digital, engineering, cloud and AI
- Work with clients across all major verticals including Financial Services, Manufacturing, Life Sciences and Healthcare, Technology and Services, Telecom and Media, Retail and CPG, and Public Services
#Site Reliability Engineering#Operational Excellence#Dynatrace#Observability#OpenTelemetry#Kubernetes#GKE#Istio#Kafka#FinOps#GCP#Cloud