Site Reliability Engineering Glossary Definition

Term Site Reliability Engineering
Definition

Site Reliability Engineering is a Cloud reliability or observability concept used to understand system behavior, measure service health, and recover from failures.

Site Reliability Engineering (SRE) is a DevOps operations and reliability concept used to observe service behavior, respond to failures, and improve resilience over time.

Context & Usage

Operations and reliability teams use this concept when setting objectives, investigating incidents, improving resilience, and communicating service health.

Related concepts include Observability.

Additional Resource: CNCF Cloud Native Glossary.

Site Reliability Engineering and operations teams use this concept to measure service health, investigate incidents, and turn operational learning into improvement.

Related concepts include DevOps and Incident Response.

Additional Resource: Google Site Reliability Engineering Book.

Categories Technical Writing and Documentation, Knowledge Management and Content Governance, Software Development and Programming, Web, Database, Cloud, and DevOps Technologies