Position Responsibilities:
· Manage and develop engineers responsible for public cloud, private cloud, virtualization, compute, storage, backup, operating systems, and related infrastructure services.
· Mature hybrid cloud operations strategy, service catalog, reference architectures, landing-zone standards, support model, capacity plan, lifecycle roadmap, and improvement backlog.
· Oversee day-to-day service health, incident response, problem management, change execution, patching, vulnerability remediation, configuration, capacity, backup, recovery, and operational readiness.
· Provide hands-on architecture review and escalation support for complex cloud, virtualization, compute, storage, backup, operating system, identity, network, automation, security, and recovery issues.
· Ensure cloud and infrastructure services meet availability, performance, security, compliance, data protection, and disaster recovery requirements.
· Implement consistent landing-zone, identity, network, tagging, policy, logging, monitoring, backup, and configuration standards across public and private cloud estates.
· Serve as the cloud architecture authority for workload placement, platform guardrails, resilience, connectivity, identity integration, cost optimization, and production readiness.
· Drive infrastructure automation, infrastructure as code, policy as code, self-service provisioning, configuration compliance, and standardized hybrid cloud deployment patterns.
· Define and report service-level objectives, reliability indicators, capacity trends, risk, technical debt, asset lifecycle, cloud consumption, and unit-cost metrics.
· Lead major incident response and root-cause analysis for infrastructure events, ensuring corrective actions are assigned, tracked, and validated.
· Partner across teams to deliver secure, supportable, cost-effective cloud infrastructure solutions.
· Manage strategic vendors, managed service providers, licensing, contracts, budgets, forecasts, and optimization commitments.
· Maintain tested recovery plans, operational documentation, runbooks, escalation paths, and audit-ready evidence.