> ## Documentation Index
> Fetch the complete documentation index at: https://docs.runlayer.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Monitoring

> Monitoring, observability, and alerting for Runlayer

# Monitoring

Runlayer provides comprehensive monitoring and observability capabilities to ensure optimal performance, security, and reliability of your deployment.

## Monitoring Architecture

### Observability Stack

```mermaid theme={null}
graph TB
    subgraph "Application Layer"
        Gateway[Gateway Service]
        Auth[Auth Service]
        Worker[Worker Service]
        UI[Web UI]
    end

    subgraph "Infrastructure Layer"
        ALB[Load Balancer]
        ECS[ECS Fargate]
        RDS[(PostgreSQL)]
        Redis[(Redis Cache)]
    end

    subgraph "Monitoring Stack"
        CloudWatch[CloudWatch]
        Logs[CloudWatch Logs]
        Metrics[Custom Metrics]
        Alerts[CloudWatch Alarms]
    end

    subgraph "Dashboards"
        Grafana[Grafana Dashboards]
        AWS[AWS Console]
        Custom[Custom Dashboards]
    end

    Gateway --> CloudWatch
    Auth --> CloudWatch
    Worker --> CloudWatch
    UI --> CloudWatch
    ALB --> Logs
    ECS --> Metrics
    RDS --> CloudWatch
    Redis --> CloudWatch
    CloudWatch --> Alerts
    Metrics --> Grafana
    Logs --> AWS
    Alerts --> Custom
```

## Application Monitoring

### Performance Metrics

* **Response Times**: API endpoint latency and throughput
* **Error Rates**: HTTP error codes and application exceptions
* **Resource Usage**: CPU, memory, and disk utilization
* **Database Performance**: Query execution times and connection pools

### Business Metrics

* **User Activity**: Login rates, session duration, feature usage
* **API Usage**: Request volumes, rate limiting, quota usage
* **Resource Management**: Cloud resource provisioning and costs
* **Governance Events**: Policy violations and compliance metrics

## Infrastructure Monitoring

### AWS CloudWatch Integration

* **EC2/ECS Metrics**: Container and instance performance with 365-day log retention
* **RDS Monitoring**: Enhanced database performance monitoring including CPU, memory, disk queue depth, IOPS, and storage utilization
* **Load Balancer**: Request distribution, health checks, and 5XX error tracking with configurable thresholds
* **Network**: VPC Flow Logs for comprehensive network traffic analysis and security monitoring
* **Prestart Containers**: Dedicated monitoring for database migration and initialization processes

### Enhanced RDS Monitoring

* **Core Metrics**: CPU utilization, database connections, and availability monitoring
* **Memory Management**: Freeable memory tracking with configurable thresholds (default: 256MB)
* **Storage Performance**: Disk queue depth monitoring for I/O bottlenecks (default: threshold 5)
* **IOPS Monitoring**: Read and Write IOPS tracking for performance optimization (default: 1000 IOPS)
* **Storage Utilization**: Free storage space monitoring to prevent capacity issues (default: 100GB threshold)
* **Configurable Alerts**: All RDS metrics support custom periods, thresholds, and units

### Custom Metrics

* **Application Health**: Service availability and health checks
* **Business KPIs**: Custom business logic metrics
* **Security Events**: Authentication failures and access violations
* **Performance Baselines**: Historical performance comparisons

## Alerting & Notifications

### Alert Categories

* **Critical**: Service outages and security incidents
* **Warning**: Performance degradation and capacity issues
* **Info**: Maintenance events and configuration changes

### Notification Channels

* **Email**: Team and individual notifications
* **Slack**: Real-time team collaboration
* **PagerDuty**: On-call escalation and incident management
* **Webhooks**: Custom integration endpoints

## Logging & Audit

### Centralized Logging

* **Application Logs**: Structured JSON logging with correlation IDs
* **Access Logs**: HTTP request/response logging
* **Audit Logs**: User actions and system changes
* **Security Logs**: Authentication and authorization events

### Log Management

* **Retention**: Enhanced log retention with 365-day default for production ECS services and migration containers
* **Search**: Full-text search and filtering capabilities across all CloudWatch log groups
* **Export**: Log export for compliance and analysis
* **Archival**: Long-term storage for regulatory requirements
* **VPC Flow Logs**: Network traffic analysis with configurable traffic type monitoring (ALL, ACCEPT, REJECT)

## Enterprise Monitoring Services

For advanced monitoring and observability, including:

* **Custom Dashboard Development** - Tailored monitoring dashboards
* **Advanced Alerting** - Complex alerting rules and escalation
* **Performance Optimization** - Monitoring-driven performance tuning
* **Capacity Planning** - Predictive scaling and resource planning
* **SLA Monitoring** - Service level agreement tracking
* **24/7 Monitoring** - Round-the-clock monitoring and response

<Card title="Enterprise Monitoring Services" icon="chart-line" href="mailto:support@runlayer.com">
  Contact our monitoring experts for comprehensive observability and alerting
  setup
</Card>

## Monitoring Best Practices

### Metrics Collection

* **Golden Signals**: Latency, traffic, errors, and saturation
* **RED Method**: Rate, errors, and duration for services
* **USE Method**: Utilization, saturation, and errors for resources
* **Custom Metrics**: Business-specific monitoring requirements

### Dashboard Design

* **Executive Dashboards**: High-level business metrics
* **Operational Dashboards**: Real-time system health
* **Troubleshooting Views**: Detailed diagnostic information
* **Mobile-Friendly**: Responsive design for mobile access

### Alert Management

* **Alert Fatigue Prevention**: Meaningful alerts with proper thresholds
* **Escalation Procedures**: Clear escalation paths and responsibilities
* **Runbook Integration**: Automated response procedures
* **Post-Incident Reviews**: Continuous improvement processes

## Performance Baselines

### Baseline Metrics

* **Response Time**: 95th percentile under 200ms
* **Availability**: 99.9% uptime SLA
* **Error Rate**: Less than 0.1% error rate
* **Throughput**: Configurable based on deployment size

### Capacity Planning

* **Growth Projections**: Predictive scaling based on trends
* **Resource Optimization**: Right-sizing recommendations
* **Cost Monitoring**: Resource cost tracking and optimization
* **Performance Testing**: Load testing and capacity validation

## Compliance Monitoring

### Regulatory Requirements

* **Audit Trail**: Comprehensive activity logging
* **Data Retention**: Compliance with retention policies
* **Access Monitoring**: User access and privilege tracking
* **Change Management**: Configuration change tracking

***

**For ECS deployment monitoring specifics, see:**
[ECS Deployment & Infrastructure Documentation](https://github.com/runlayer/Runlayer/tree/main/infra/aws-terraform-ecs/README.md)

Contact our monitoring team for custom monitoring solutions, advanced alerting setup, and comprehensive observability implementation.
