Maximum of 25 job preferences reached.
Top SRE Engineer Jobs in Chicago, IL
Information Technology • Consulting
As a Senior Staff Site Reliability Engineer, you will lead the SRE team, advocate best practices, ensure resilience in cloud architecture, and mentor team members.
Top Skills:
ArgocdCircleCIGoogle Cloud PlatformKubernetesPulumiTerraformTypescript
Artificial Intelligence • Cloud • Information Technology • Software
Build and operate production-grade AI infrastructure using Kubernetes, ensuring high availability, reliability, and performance. Develop custom operators and implement automation for efficient operations and monitoring.
Top Skills:
AnsibleBashElk StackEnterprise Storage SystemsGrafanaHigh-Performance NetworkingKubernetesLinuxNvidia Gpu TechnologiesPrometheusPythonTerraform
Cloud • Information Technology • Consulting • Design • Generative AI
Design, scale, and maintain enterprise observability and alerting across multi-cloud and hybrid systems. Build observability stacks (Prometheus, Grafana, GCP observability), automate infrastructure with Terraform/Ansible, integrate CI/CD for containerized workloads on Kubernetes/GKE/OpenShift, optimize Linux systems, and implement SRE practices (SLIs/SLOs/Error Budgets).
Top Skills:
AnsibleCloud LoggingCloud MonitoringCloud ProfilerCloud TraceGitGoGoogle Cloud Platform (Gcp)Google Kubernetes Engine (Gke)GrafanaGrafana Enterprise Metrics (Gem)HarnessJavaKubernetesLinuxPerlPrometheusPythonRed Hat OpenshiftShell ScriptingTerraform
Cloud
The role involves building and managing observability infrastructure in GCP, automating deployments, and optimizing data processes for high reliability.
Top Skills:
GkeGoGCPGrafanaKubernetesOpentelemetryPythonRubySplunkTerraform
Healthtech • Software
Design, automate, and maintain scalable infrastructure and SRE tooling. Manage Kubernetes clusters, CI/CD, monitoring, and incident response. Improve processes, reduce toil via automation, and collaborate with engineering and data teams to support domestic and international workloads.
Top Skills:
AWSAzureContainerdDnsDockerFirewallsGCPGoGrpcHelmKubernetesLinuxLoad BalancingPrometheusPythonRoutingShell ScriptingTcp/IpUdp
Financial Services
Prototype, write, test, document, and deploy release automation across environments. Build and maintain pipelines, collaborate with engineers and product teams, troubleshoot issues, participate in on-call rotation, and improve software delivery, configuration, monitoring, and operations.
Top Skills:
AnsibleBashDockerGitlabJenkinsKubernetesMssqlPostgresPowershellPythonRedisTeamcity
Software • Consulting
Lead 24x7 application support for external web applications: manage incidents, perform RCA, implement preventative fixes, build monitoring/alerts, expand Splunk functionality, create dashboards, collaborate with development and platform teams, and participate in on-call rotation.
Top Skills:
ApmAppdynamicsAWSDatadogGrafanaKubernetesLinuxMulesoftOpenshiftOpentelemetryPostmanPythonRumSeleniumServicenowShell ScriptingSplunk (Spl)Splunk CloudSplunk Observability CloudSplunk Synthetics
Software
Lead SRE to define SRE strategy, architecture, and roadmap; design and operate containerized, compliant cloud environments; build observability, incident management, automation, and developer platform capabilities; mentor SRE team and collaborate with security, compliance, and product teams to ensure reliability at scale.
Top Skills:
AWSAws MarketplaceAzureAzure MarketplaceGCPGoogle Cloud MarketplaceGrafanaKubernetesPrometheusTerraform
Artificial Intelligence • Other • Sales • Software
The role involves designing and advancing infrastructure for the engineering team, ensuring the reliability of Kubernetes clusters, automating operations, and building machine learning infrastructure.
Top Skills:
ArgoAWSAzureCloudFormationFluxGithub ActionsGoGCPKubernetesPostgresPythonTerraform
Agency • Information Technology
Lead SRE role designing and maintaining CI/CD pipelines (GitHub Actions), containerized deployments (Docker, Kubernetes, AKS, Helm), web/mobile app releases, observability, automated testing, and DevOps best practices across cloud environments with cross-functional collaboration and regulatory compliance.
Top Skills:
AksAndroidAzure Application InsightsAzure Log AnalyticsAzure MonitorBashBranchingDockerDocker ComposeGitGit HooksGithub ActionsGoogle PlayHelmHerokuiOSIos App StoreJavaKubernetesNpmPowershellPull RequestsPythonSonarqubeVeracodeVercel
Artificial Intelligence • Insurance • Software • Automation
The Staff Site Reliability Engineer will build and scale infrastructure for Assured's platform, automate delivery, enhance observability, and lead mentoring initiatives.
Top Skills:
AWSKubernetesPostgresTerraform
Healthtech • Social Impact • Software
Own the operational lifecycle of cloud-native data infrastructure: design and automate reliable deployments, observability, incident response, SLIs/SLOs, autoscaling and IaC, and improve platform efficiency and data freshness across GKE and Cloud Run.
Top Skills:
BashBigQueryCloud BuildCloud MonitoringCloud RunDatadogDockerGCPGithub ActionsGkeGoGrafanaJIRAKubernetesPrometheusPulumiPythonSentrySlackSnykSonarqubeTerraform
New
Cut your apply time in half.
Use ourAI Assistantto automatically fill your job applications.
Use For Free
Software
Own and improve platform performance, reliability, and deployment automation. Manage cloud infrastructure, implement IaC, monitor systems with observability tools, provide operational support for distributed applications, and integrate production learnings into development workflows.
Top Skills:
Aiops ToolingAws Elastic ContainersAws RdsAws S3Claude CodeClaude CoworkDatadogHarness EngineeringInfrastructure As CodeKubernetesLlmsPrompt EngineeringRigorSplunk
Cloud • Security • Software • Cybersecurity
Lead reliability for a serverless AI inference platform: own observability and SLO/SLI frameworks, build automation and tooling, manage incidents and on-call, define deployment safety (canaries, rollbacks), influence architecture with product teams, and mentor other SREs.
Top Skills:
AutoscalingCi/CdContainer OrchestrationContainerizationGoGpu WorkloadsInfrastructure-As-CodeKubernetesModel ServingPythonResource Scheduling
Software
Senior SRE responsible for production reliability of Grafana Cloud databases (Mimir, Loki, Tempo, Pyroscope). Partner with product squads, define per-tenant SLOs, automate reliability practices, lead incident response/on-call, reduce toil, improve alerting, and influence design for scalability and operability.
Top Skills:
AWSAzureGCPGoGrafana CloudHelmJavaJsonnetKubernetesLinuxLokiMimirPyroscopePythonTempoTerraform
Artificial Intelligence • Healthtech • Software • Telehealth
Design, deploy, and maintain AWS-hosted Kubernetes (EKS) infrastructure; build automation and AI-assisted runbooks; provide observability and incident response; ensure HIPAA-compliant, high-availability platform operations and mentor engineering teams.
Top Skills:
AWSBashDatadogEc2EksGitGithub ActionsGoHelmKubernetesPythonRdsS3Terraform
Other
The Senior Site Reliability Engineer at Juul Labs ensures operational stability and performance of hybrid cloud infrastructure, leads automation, and handles critical incidents.
Top Skills:
AWSBashCloudFormationGCPNutanixPowershellPythonTerraform
Digital Media • Social Media • Software • Sports
Lead the technical architecture and execution of migration to AWS, drive developer enablement, and automate infrastructure using code-first principles.
Top Skills:
Aws EksDatadogGithub ActionsGoIstioK6KubernetesNode.jsTerraform
Computer Vision • Machine Learning • Software
As a Site Reliability Engineer, ensure the reliability, performance, and scalability of Ditto's cloud infrastructure by developing observability solutions, leading incident management, and collaborating with product engineering teams.
Top Skills:
AWSAzureCDatadogGCPGoGrafanaHelmJavaKubernetesPrometheusRustTerraform
Artificial Intelligence • Fintech • Machine Learning • Natural Language Processing • Business Intelligence
Lead architecture and implementation of reliability platforms and SRE practices for a production SaaS. Build self-service reliability tooling, drive AIOps automation, advance observability (monitoring, tracing, profiling), lead incident response and postmortems, mentor engineers, and embed production readiness across teams to achieve 99.99% uptime.
Top Skills:
AWSAzureContinuous ProfilingDatadogDnsElkGCPGoGrafanaHttp/SKubernetesLoad BalancingOpentelemetryPrometheusPythonTcp/Ip
Legal Tech • Software
Lead Site Reliability Engineer responsible for platform availability and reliability of RelativityOne. Drive SRE best practices, build tools, lead projects, coach SREs, work with stakeholders, support incidents, run postmortems, and improve monitoring, automation, and operational efficiency.
Top Skills:
Ci/CdDevOpsJenkinsJIRAKubernetesAzureMonitoring And AlertingNew RelicNoSQLPowershellRelativity ServerRelativityoneSQLTableau
Database • Analytics
This role involves ensuring the reliability and performance of ClickHouse's cloud infrastructure, collaborating with engineering teams, incident management, and driving continuous improvement in service availability.
Top Skills:
AnsibleAWSAzureClickhouseDocker SwarmGoGoogle Cloud PlatformKubernetesPuppetPythonTerraform
Software • Financial Services
Ensure platform reliability, performance, and availability by implementing observability, automating infrastructure, participating in on-call rotations and post-mortems, partnering with Product and Engineering, designing scalable architectures, mentoring teammates, and integrating Dynatrace with Azure DevOps and Jira while supporting compliance (SOC/FedRAMP).
Top Skills:
.NetAksAlpineAnsibleAppinsightsArm TemplatesAWSAzure DevopsBashBicepC#ChefCloudFormationDatadogDebianDynatraceEksGCPGitGitGksGrafanaHelmJIRAKubernetesLog AnalyticsAzureNew RelicOnestream SoftwareOpenshiftPowershellPowershell DscPrometheusPuppetPythonRest ApisSQLTerraformUbuntu
Fintech • Information Technology
As a Site Reliability Engineer at Alpaca, you will ensure system reliability and performance, troubleshoot issues, and collaborate with teams to design scalable features.
Top Skills:
GoGormLinuxPgxPostgresPrometheusSqlc
Healthtech
Design, scale, and operate secure AWS cloud infrastructure (EKS, IAM, RBAC); build and maintain IaC (Terraform/Terragrunt), GitHub Actions CI/CD, Datadog observability, and Python automation; document runbooks, participate in on-call rotations, postmortems, and Agile workflows to improve reliability and security.
Top Skills:
AWSDatadogEc2EksFargateGithub ActionsGithub Advanced SecurityHelmIamJIRAKubernetesLambdaPythonRbacSecrets ManagerServerlessTerraformTerragruntVpc
Let Your Resume Do The Work
Upload your resume to be matched with jobs you're a great fit for.
Success! We'll use this to further personalize your experience.
Top Chicago, IL Companies Hiring SRE Engineers
See AllPopular Chicago, IL Engineering Job Searches
Engineer Jobs in Chicago, IL
.NET Developer Jobs in Chicago, IL
Android Developer Jobs in Chicago, IL
Application Engineer Jobs in Chicago, IL
Automation Engineer Jobs in Chicago, IL
Backend Engineer Jobs in Chicago, IL
C# Jobs in Chicago, IL
C++ Jobs in Chicago, IL
Cloud Engineer Jobs in Chicago, IL
Controls Engineer Jobs in Chicago, IL
CTO Jobs in Chicago, IL
Design Engineer Jobs in Chicago, IL
DevOps Engineer Jobs in Chicago, IL
DevOps Jobs in Chicago, IL
Director of Engineering Jobs in Chicago, IL
Director of Software Engineering Jobs in Chicago, IL
Electrical Engineer Jobs in Chicago, IL
Embedded Software Engineer Jobs in Chicago, IL
Engineering Manager Jobs in Chicago, IL
Enterprise Architect Jobs in Chicago, IL
FPGA Engineer Jobs in Chicago, IL
Front End Developer Jobs in Chicago, IL
Full-Stack Engineer Jobs in Chicago, IL
Golang Jobs in Chicago, IL
Hardware Engineer Jobs in Chicago, IL
Infrastructure Engineer Jobs in Chicago, IL
iOS Developer Jobs in Chicago, IL
Java Developer Jobs in Chicago, IL
Java Full-Stack Engineer Jobs in Chicago, IL
Javascript Jobs in Chicago, IL
Lead Software Engineer Jobs in Chicago, IL
Linux Jobs in Chicago, IL
Manufacturing Engineer Jobs in Chicago, IL
Mechanical Design Engineer Jobs in Chicago, IL
Mechanical Engineer Jobs in Chicago, IL
Network Engineer Jobs in Chicago, IL
PHP Developer Jobs in Chicago, IL
Platform Engineer Jobs in Chicago, IL
Principal Engineer Jobs in Chicago, IL
Principal Software Engineer Jobs in Chicago, IL
Process Engineer Jobs in Chicago, IL
Project Engineer Jobs in Chicago, IL
Python Jobs in Chicago, IL
QA Engineer Jobs in Chicago, IL
QA Jobs in Chicago, IL
Reliability Engineer Jobs in Chicago, IL
Robotics Engineer Jobs in Chicago, IL
Ruby Jobs in Chicago, IL
Salesforce Developer Jobs in Chicago, IL
Scala Jobs in Chicago, IL
Security Engineer Jobs in Chicago, IL
Software Engineer Jobs in Chicago, IL
Software Engineering Manager Jobs in Chicago, IL
Software Test Engineer Jobs in Chicago, IL
Solutions Architect Jobs in Chicago, IL
Solutions Engineer Jobs in Chicago, IL
SRE Engineer Jobs in Chicago, IL
Staff Engineer Jobs in Chicago, IL
Staff Software Engineer Jobs in Chicago, IL
Systems Engineer Jobs in Chicago, IL
All Filters
Total selected ()
No Results
No Results




















.png)















