La biblioteca de plantillas de Scorecards proporciona una forma optimizada de abordar los casos de uso de ingeniería y negocios. Al utilizar las mejores prácticas de grandes empresas, la biblioteca ofrece soluciones para desafíos de ingeniería comunes.
Cada plantilla de la biblioteca es totalmente personalizable para cumplir con los estándares de su organización. Puede modificar las consultas, las reglas y los umbrales para adaptar el Scorecards a sus necesidades.
Algunas plantillas etiquetan sus reglas con niveles de madurez (de L0 a L3).
Plantillas de cuadro de mando
Propósito: Valida si sus servicios están listos para la implementación de producción verificando los objetivos definidos, la configuración de alertas y la actividad de implementación reciente.
Importancia: ayuda a encontrar brechas de preparación antes de desplegar en producción.
Prerrequisitos:
Reglas clave:
Defined SLOs: establece objetivos claros para el rendimiento y la confiabilidad.
APM service alerts configuration: comprueba que las alertas estén configuradas para la detección rápida de problemas.
Recent deployments: verifica los despliegues exitosos durante el último mes.
Runbook availability: confirma que existen runbooks para las condiciones de alerta activadas en el último mes.
Propósito: evalúa la confiabilidad frente a los estándares de AWS para seguridad y redundancia en operaciones cloud.
Importancia: ayuda a encontrar brechas de confiabilidad y seguridad en su infraestructura de la nube.
Prerrequisitos: Monitoreo de AWS de New Relic
Reglas clave:
- EFS Encrypted check: confirma el cifrado de los volúmenes de Elastic File System (EFS).
- RDS Instance check retention period: comprueba los períodos de retención de copias de seguridad para el servicio de base de datos relacional (RDS).
- RDS DeletionProtection check: verifica la protección contra eliminación.
- RDS MultiAZ presence check: comprueba el despliegue en múltiples zonas de disponibilidad (MultiAZ).
- RDS AutoMinorVersionUpgrade check: confirma las actualizaciones automáticas de versiones menores.
Propósito: Evalúa la asignación de recursos y las mejoras de procesos empleando indicadores de rendimiento clave.
Importancia: Cuantifica el rendimiento de la entrega de software, lo que ayuda a la toma de decisiones estratégicas.
Prerrequisitos:
Reglas clave:
Deployment frequency: rastrea las tasas de despliegue exitosas.
Mean time to recovery: mide el tiempo de recuperación ante fallas.
Change failure rate: rastrea el porcentaje de cambios que resultan en fallas.
Lead time for changes: mide el tiempo transcurrido desde la confirmación del código hasta el despliegue.
Propósito: establece y hace cumplir prácticas de etiquetado consistentes para los recursos dentro de su organización.
Importancia: las etiquetas consistentes le ayudan a filtrar y agrupar servicios en vistas como mapas y catálogos.
Requisitos previos: APM
Reglas clave:
- Team Tag Exists: comprueba que los servicios lleven una etiqueta del equipo propietario para una clara propiedad y responsabilidad.
- Environment Tag Exists: comprueba que los servicios lleven una etiqueta de entorno coherente para filtrar y agrupar.
- APM Criticality is set: comprueba que los servicios tengan una etiqueta de criticidad para priorizar por importancia comercial.
Propósito: establece una estrategia de etiqueta integral y visibilidad completa de las dependencias y relaciones del servicio.
Importancia: resalta las brechas en la cobertura de etiquetas, relaciones, traza y sintético para que pueda abordarlas.
Prerrequisitos:
Reglas clave:
(L0) Team Tag Coverage: identifica las entidades a las que les falta una etiqueta
team.(L0) Environment Tag Coverage: identifica las entidades a las que les falta una etiqueta
environment.(L0) Uninstrumented Entities: marca las entidades de servicio HTTP y base de datos con relaciones desconocidas que necesitan instrumentación adicional.
(L0) Distributed Trace Coverage: mide el porcentaje de entidades de APM que emiten datos de rastreo distribuido.
(L0) Synthetic Coverage: mide el porcentaje de entidades de APM cubiertas por monitores sintéticos.
Propósito: desarrolla una estrategia integral de alertas y un enfoque de gestión de incidentes para la confiabilidad del servicio.
Importancia: resalta las brechas de alerta, el ruido y la cobertura de SLI para que pueda priorizar los servicios críticos.
Prerrequisitos:
Administración a nivel de servicio
Reglas clave:
(L1) Infrastructure Alert Coverage: identifica los hosts y los pods de Kubernetes que carecen de cobertura de alertas.
(L1) Service Delivery Alert Coverage: identifica los servicios, el navegador, los dispositivos móviles y los monitores sintéticos que carecen de cobertura de alerta.
(L1) Critical Alert Coverage: marca la dependencia excesiva de las condiciones de alerta crítica que pueden causar exceso de alertas.
(L1) Alert Noise: identifica las políticas que generan un alto volumen de incidentes.
(L2) Service Level Coverage: comprueba si las entidades tienen un indicador de nivel de servicio (SLI) definido.
(L2) Alerts Mean Time To Close: evalúa el tiempo necesario para cerrar incidentes, con el objetivo de resolverlos en 30 minutos.
(L2) APM Criticality Tag Coverage: identifica las entidades a las que les falta una etiqueta
criticality.(L3) Service Level Attainment: evalúa la puntuación de cumplimiento para cada SLI definido, utilizando un umbral predeterminado del 95 %.
Propósito: enfatiza el uso eficiente de los recursos y las prácticas de seguridad sólidas mediante el monitoreo del uso de la CPU y la memoria, la integración del seguimiento de cambios y la detección de vulnerabilidades.
Importancia: cumplir con los estándares de recursos, seguimiento de cambios y seguridad le ayuda a ejecutar una infraestructura eficiente y segura.
Prerrequisitos:
Reglas clave:
(L1) CPU Utilization: comprueba el percentil 95 del uso de CPU para las entidades de infraestructura frente a las mejores prácticas de eficiencia.
(L1) Memory Utilization: comprueba el percentil 95 del uso de memoria para la entidad de infraestructura frente a las mejores prácticas de eficiencia.
(L2) Change Tracking: comprueba si hay eventos de seguimiento de cambios en sus entidades de APM.
(L3) Service Vulnerabilities: comprueba el porcentaje de entidades de APM con vulnerabilidades detectadas.
Propósito: monitorea el rendimiento del frontend y la interacción del usuario a través de errores de JavaScript, errores HTTP 5xx y métricas de Métricas web principales.
Importancia: cumplir con los estándares de errores de frontend y Core Web Vitals le ayuda a mantener una sólida experiencia del usuario.
Prerrequisitos:
Administración a nivel de servicio
Reglas clave:
(L1) JS Error Rate: comprueba el porcentaje de entidades de navegador con errores de JavaScript.
(L1) Service Error Rate: comprueba el porcentaje de servicios de APM que reportan errores 5xx en las requests HTTP.
(L2) Core Web Vitals: Largest Contentful Pane (LCP): marca las entidades cuyo LCP del percentil 75 supera los 2.5 segundos.
(L2) Core Web Vitals: Interaction to Next Paint (INP): marca las entidades cuyo INP del percentil 75 supera los 200 milisegundos.
(L2) Core Web Vitals: Cumulative Layout Shift (CLS): marca las entidades cuyo CLS del percentil 75 supera 0.1.
(L3) Service Level Attainment: evalúa la puntuación de cumplimiento para cada SLI definido, utilizando un umbral predeterminado del 95 %.
Propósito: evalúa el riesgo de vulnerabilidades en los servicios de APM y la infraestructura.
Importancia: sacar a la luz las vulnerabilidades críticas y de alta gravedad, los CVE de ransomware activos y la probabilidad de explotación ayuda a priorizar la corrección.
Prerrequisitos:
Reglas clave:
APM: Under 3 Critical Severity: comprueba que un servicio de APM tenga menos de 3 vulnerabilidades de gravedad crítica.
APM: Under 5 High Severity: comprueba que un servicio de APM tenga menos de 5 vulnerabilidades de alta gravedad.
APM: Active Ransomware: marca los CVE informados que tienen una campaña de ransomware activa.
APM: Exploit Probability: marca las vulnerabilidades críticas o de alta gravedad que probablemente sean explotadas (percentil 95+ de EPSS).
INFRA: Under 3 Critical Severity: comprueba que un host o contenedor tenga menos de 3 vulnerabilidades de gravedad crítica.
INFRA: Under 5 High Severity: comprueba que un host o contenedor tenga menos de 5 vulnerabilidades de alta gravedad.
INFRA: Active Ransomware: marca los CVE informados que tienen una campaña de ransomware activa.
INFRA: Exploit Probability: marca las vulnerabilidades críticas o de alta gravedad que probablemente sean explotadas (percentil 95+ de EPSS).
Propósito: mide la calidad operativa y la gobernanza de las respuestas de IA en términos de seguridad, rentabilidad y cumplimiento del modelo.
Importancia: cumplir con los estándares de calidad y gobernanza de la IA ayuda a mantener el uso de la IA de manera responsable y rentable.
Prerrequisitos: monitoreo de IA
Reglas clave:
- LLM Runtime Error Rate: comprueba que las aplicaciones habilitadas para LLM mantengan una baja tasa de errores operativa.
- Cost Efficiency - Average tokens per assistant response: comprueba que el recuento promedio de tokens por respuesta del asistente se mantenga dentro del presupuesto.
- Model Governance - Approved model usage for assistant responses: comprueba que solo se utilicen modelos aprobados para las respuestas del asistente en producción.