Maximum of 25 job preferences reached.
Top Reliability Engineer Jobs in Chicago, IL
Fintech • Payments • Financial Services
Lead infrastructure resilience by implementing observability, IaC, automation, and AI-driven detection to ensure cloud and SaaS system stability. Drive tooling, alerts, self-healing, CI/CD optimization, incident triage/restore, and partner across architecture and engineering to improve performance, reliability, and cost efficiency.
Top Skills:
Ai/Ml FrameworksAWSCi/CdCloudFormationCloudwatchDevsecopsDynatraceJavaKubernetesOraclePythonSplunkSQL ServerTerraform
Automotive
Leads SRE engineering leaders and engineers while defining enterprise observability, reliability, and platform strategy across GCP, on-premise, manufacturing, distribution, and campus environments. Oversees vendor-agnostic tooling, OpenTelemetry integrations, CI/CD observability, SRE maturity models, and Agentic AI initiatives. Drives adoption of SRE practices, develops technical roadmaps, partners with senior leadership and operational teams, and maintains hands-on architectural and technical credibility.
Top Skills:
Agentic AiAWSAzureCi/CdDatadogDynatraceGCPNew RelicOpentelemetryOtel Genai Semantic ConventionsSource Control PlatformsSplunkTerraform
Fintech
Lead SRE work partnering with development teams to design and implement availability, scalability, observability, and automation for production systems. Build tooling, manage incident response and RCAs, optimize capacity and performance, mentor engineers, maintain runbooks, and participate in a 24x7 on-call rotation.
Top Skills:
AuroraAWSChefCi/CdDockerDynamoDBGitGoIpJavaJavaScriptJenkinsJmsKafkaKubernetesLinuxMavenMemcachedMicroservicesObservabilityOraclePythonRedisRubySqsSwarmTcpUdp
Software
Lead reliability engineering for Silicon Photonics hardware: define and validate reliability models, perform MTBF/MTBCF predictions, analyze field data, direct verification testing and root-cause analysis, drive corrective actions, and mentor cross-functional teams to improve product reliability.
Top Skills:
Derating AnalysisDfmeaMtbcfMtbfSherlockSilicon PhotonicsTelcordiaThermal DesignWindchill Qs
Database • Analytics
As a Database Reliability Engineer at ClickHouse, you'll improve reliability, manage escalation processes, support incident response, and enhance database performance while collaborating across teams.
Top Skills:
AWSAzureC++ClickhouseGoogle Cloud PlatformPythonShellSQL
Software
Drive reliability qualification and production monitoring for optical communication products. Track and analyze reliability stress tests, investigate failures with cross-functional teams, implement corrective actions, maintain dashboards and reports, support NPI, and apply statistical and AI tools to generate reliability insights and improve product quality.
Top Skills:
AIJmp/JslMinitabSQL
eCommerce • Healthtech • Kids + Family • Retail • Social Media
Own and evolve Babylist's AWS infrastructure and developer platform using Terraform and Kubernetes. Improve CI/CD reliability, support engineers across environments, define monitoring and alerting standards, lead incident response and postmortems, and shape platform architecture to scale for millions of users.
Top Skills:
AWSCdnCircleCICronitorDatadogDnsEksGithub ActionsKubernetesLoad BalancersMySQLPagerdutyRdsRedisRuby On RailsSentrySidekiqTerraform
Information Technology • Software • Database • Automation
Owner of on-prem reliability and escalations: reproduce and resolve L2/L3 issues across heterogeneous Kubernetes environments, build diagnostics and automation, improve CI and e2e test stability, establish performance baselines, harden install/upgrade flows, and write tooling in Python/Go/Rust to reduce repeat incidents.
Top Skills:
BenchmarkingCiCi/CdContainersE2E TestingGoHealth ChecksHelmInstallersIntegration TestingKubernetesLoad GenerationLogsMetricsNetworkingObservabilityPackagingProfilingPythonRbacRustStorageSupport BundlesTraces
25 Days AgoSaved
Software • Defense
Work as an SRE embedded with product teams to improve reliability by fixing application code (primarily TypeScript), building observability (Prometheus, Loki, Grafana, Alloy), defining SLIs/SLOs, leading incident response and postmortems, automating toil, and supporting deployments across on‑prem DoD and AWS environments.
Top Skills:
AlloyAWSBashContainersDockerGithub ActionsGitlab Ci/CdGoGrafanaJenkinsKubectlKubernetesLokiNode.jsPrometheusPythonTypescript
Reposted 6 Days AgoSaved
Information Technology • Insurance • Professional Services • Software
The Senior Site Reliability Engineer will enhance system reliability through infrastructure automation, support core applications, and optimize performance, collaborating with development teams on deployment processes.
Top Skills:
AWSCdktfCircleCICloudfrontDockerElasticsearchGithub ActionsJenkinsLambdaRdsRedisRuby On RailsS3TerraformTypescript
Fintech • Payments
The Senior Staff SRE leads reliability engineering initiatives, drives operational excellence, mentors staff, and influences architecture to enhance system reliability and performance.
Top Skills:
Ai/MlAWSAzureDockerElk StackGCPGrafanaKubernetesMySQLNoSQLPostgresSplunk
Software
Lead ownership and support of production database systems (MySQL CloudSQL and Spanner). Drive schema change processes, build automated deploy/test pipelines, implement monitoring/alerting, manage backup/recovery and DR, perform production debugging/RCA, and evaluate database features for global scalability and uptime.
Top Skills:
Cloud SqlGoogle Cloud Platform (Gcp)Google Cloud SpannerInfrastructure As CodeMysql 8.4RedisShardingSQL
New
Cut your apply time in half.
Use ourAI Assistantto automatically fill your job applications.
Use For Free
Information Technology • Consulting
As a Senior Staff Site Reliability Engineer, you will lead the SRE team, advocate best practices, ensure resilience in cloud architecture, and mentor team members.
Top Skills:
ArgocdCircleCIGoogle Cloud PlatformKubernetesPulumiTerraformTypescript
Financial Services
Design, build, and operate reliable cloud infrastructure and networking (multi-account AWS, VPC, IAM). Implement IaC, CI/CD pipelines, observability (logging/metrics/alerting), automation, and reliability guardrails. Provide production support and incident response, perform root cause analysis, and collaborate with application teams to co-own system design and continuous improvement, using AI-assisted tools where appropriate.
Top Skills:
.NetAi-Assisted Tools (Claude CodeAWSAws OrganizationsBashCi/CdCloudFormationElastic StackGitGithub CopilotIamInfrastructure As CodeJavaJenkinsNode.jsObservabilityOpensearchPowershellPythonTerraformVpcWindsurf)
Healthtech • Professional Services • Pharmaceutical
Lead platform and infrastructure engineering: build full-stack services, design AWS/Terraform infrastructure, manage Kubernetes/Docker, implement CI/CD, improve reliability and security, mentor engineers, and drive compliance for HIPAA and SOC 2.
Top Skills:
ArgocdAWSCloudwatchDatadogDockerGithub ActionsGitopsGrafanaJenkinsKubernetesPrometheusPythonReactTerraformTypescript
Software
Lead reliability activities for photonic integrated circuits (PICs): evaluate failure modes, coordinate accelerated stress tests, develop life models from aging-data, and drive failure mode analyses across design, development, and production teams.
Artificial Intelligence • Fintech • Machine Learning • Natural Language Processing • Business Intelligence
Lead architecture and implementation of reliability platforms and SRE practices for a production SaaS. Build self-service reliability tooling, drive AIOps automation, advance observability (monitoring, tracing, profiling), lead incident response and postmortems, mentor engineers, and embed production readiness across teams to achieve 99.99% uptime.
Top Skills:
AWSAzureContinuous ProfilingDatadogDnsElkGCPGoGrafanaHttp/SKubernetesLoad BalancingOpentelemetryPrometheusPythonTcp/Ip
Artificial Intelligence • Fintech • Machine Learning • Software • App development • Conversational AI • Generative AI
Own and improve production infrastructure reliability, deployments, Infrastructure-as-Code, Kubernetes environments, automation, CI/CD, monitoring, alerting, and observability. Investigate incidents, optimize system performance, maintain documentation and runbooks, and support DNS, WAF, CDN, and caching infrastructure. The role requires strong Linux administration, Bash scripting, networking, Git, and containerization skills, with independent ownership and collaboration across development and operations teams.
Top Skills:
AkamaiAmqpAnsibleAWSBashCdnCloudflareDnsDockerGCPGitGitlab CiGrafanaHttp/HttpsKubernetesLinuxPodmanPrometheusPythonRabbitMQTerraformVictoriametricsWafZabbix
Automotive
Design and implement scalable cloud infrastructure, monitor performance, automate processes, ensure security and compliance, and lead a DevOps team.
Top Skills:
AWSBashCi/CdDockerElk StackGCPGrafanaKubernetesPrometheusPythonTerraform
Cloud • Software
The Senior Site Reliability / Gitops Engineer will drive automation and collaboration within the IS team, enhancing Canonical's IT operations and services while managing infrastructure as code and cloud technologies.
Top Skills:
Cloud ComputingDockerElasticsearchGitopsGrafanaIacKubernetesLinuxPrometheusPython
Cloud • Software
As a Site Reliability / Gitops Engineer, you will automate operations, develop Infrastructure as Code, maintain core services, and collaborate on service architecture.
Top Skills:
Ci/CdCloud ComputingElasticsearchGrafanaInfrastructure As CodeLinuxPrometheusPython
Cloud • Software
The Site Reliability Engineer will ensure reliable cloud operations by applying Python for infrastructure automation, managing OpenStack and Kubernetes, and practicing devsecops in a fast-paced environment.
Top Skills:
KubernetesLinuxOpenstackPython
Cloud • Security • Software • Cybersecurity
As a Site Reliability Engineer II, you'll automate tasks, monitor AI workloads, enhance dashboards, support CI/CD processes, and collaborate with engineering teams on complex issues while participating in on-call rotations.
Top Skills:
GoGrafanaKubernetesLinuxPrometheusPythonSaltstackTerraform
Software • Cybersecurity
This role involves managing Kubernetes clusters, cloud infrastructure, and CI/CD pipelines. The engineer will enhance system reliability and efficiency while troubleshooting production issues.
Top Skills:
AlertmanagerAWSAzureBashCi/CdDockerElastic StackElasticsearchGCPGoGrafanaHelmKafkaKubernetesLokiMongoDBOciPrometheusPythonRedisSparkTerraform
Software • Web3
Lead reliability practices across teams: embed early in projects, define SLIs/SLOs, build multi-cloud paved roads with Terraform, run on-call, drive org-wide incident maturity and tooling.
Top Skills:
AWSAzureGCPRuby On RailsTerraformTypescriptWebcontainers
Let Your Resume Do The Work
Upload your resume to be matched with jobs you're a great fit for.
Success! We'll use this to further personalize your experience.
Top Chicago, IL Companies Hiring Reliability Engineers
See AllPopular Chicago, IL Engineering Job Searches
Engineering Jobs in Chicago, IL
.NET Developer Jobs in Chicago, IL
Android Developer Jobs in Chicago, IL
Application Engineer Jobs in Chicago, IL
Automation Engineer Jobs in Chicago, IL
Backend Engineer Jobs in Chicago, IL
C# Jobs in Chicago, IL
C++ Jobs in Chicago, IL
Cloud Engineer Jobs in Chicago, IL
Controls Engineer Jobs in Chicago, IL
CTO Jobs in Chicago, IL
Design Engineer Jobs in Chicago, IL
DevOps Engineer Jobs in Chicago, IL
DevOps Jobs in Chicago, IL
Director of Engineering Jobs in Chicago, IL
Director of Software Engineering Jobs in Chicago, IL
Electrical Engineering Jobs in Chicago, IL
Embedded Software Engineer Jobs in Chicago, IL
Engineering Manager Jobs in Chicago, IL
Enterprise Architect Jobs in Chicago, IL
FPGA Engineer Jobs in Chicago, IL
Front End Developer Jobs in Chicago, IL
Full-Stack Engineer Jobs in Chicago, IL
Golang Jobs in Chicago, IL
Hardware Engineer Jobs in Chicago, IL
Infrastructure Engineer Jobs in Chicago, IL
iOS Developer Jobs in Chicago, IL
Java Developer Jobs in Chicago, IL
Java Full-Stack Engineer Jobs in Chicago, IL
Javascript Jobs in Chicago, IL
Lead Software Engineer Jobs in Chicago, IL
Linux Jobs in Chicago, IL
Manufacturing Engineer Jobs in Chicago, IL
Mechanical Design Engineer Jobs in Chicago, IL
Mechanical Engineering Jobs in Chicago, IL
Network Engineer Jobs in Chicago, IL
PHP Developer Jobs in Chicago, IL
Platform Engineer Jobs in Chicago, IL
Principal Engineer Jobs in Chicago, IL
Principal Software Engineer Jobs in Chicago, IL
Process Engineer Jobs in Chicago, IL
Project Engineer Jobs in Chicago, IL
Python Jobs in Chicago, IL
QA Engineer Jobs in Chicago, IL
QA Jobs in Chicago, IL
Reliability Engineer Jobs in Chicago, IL
Robotics Engineer Jobs in Chicago, IL
Ruby Jobs in Chicago, IL
Salesforce Developer Jobs in Chicago, IL
Scala Jobs in Chicago, IL
Security Engineer Jobs in Chicago, IL
Software Engineer Jobs in Chicago, IL
Software Engineering Manager Jobs in Chicago, IL
Software Test Engineer Jobs in Chicago, IL
Solutions Architect Jobs in Chicago, IL
Solutions Engineer Jobs in Chicago, IL
SRE Engineer Jobs in Chicago, IL
Staff Engineer Jobs in Chicago, IL
Staff Software Engineer Jobs in Chicago, IL
Systems Engineer Jobs in Chicago, IL
All Filters
Total selected ()
No Results
No Results





























