# Том 19. Эксплуатация, SLA и техническая поддержка

## 19.1. Цель

Определить модель эксплуатации национальной платформы Digital Kazakhstan Experience / KazResource OS: линии поддержки, категории инцидентов, SLA/SLO/SLI, мониторинг, резервирование, backup/DR, патчинг, capacity management, документацию и отчётность.

---

## 19.2. Линии поддержки

| Линия | Состав | Обязанности | Канал | Время отклика |
|-------|--------|-------------|-------|---------------|
| **L1** | Service Desk / Help Desk | Регистрация, классификация, маршрутизация, FAQ, базовые инструкции | Телефон, чат, email, портал | 15 мин |
| **L2** | Прикладные и инфраструктурные специалисты | Frontend, backend, 3D, AI, data, integrations, устранение стандартных инцидентов | Тикет-система, Slack/Teams | 1 ч |
| **L3** | Разработчики и вендоры | Исправление дефектов, сложные интеграции, AI-модели, security investigations | Jira, escalations | 4 ч (раб. время) |
| **L4** | Производители оборудования и специализированные эксперты | OT/SCADA вендоры, GPU/сетевые инженеры, blockchain/CBDC эксперты | Vendor portal, on-site | 8 ч–5 дней (зависит от SLA) |

---

## 19.3. Категории инцидентов

| Severity | Описание | Примеры | Время реакции | Время восстановления | Эскалация | Информирование |
|----------|----------|---------|---------------|----------------------|-----------|----------------|
| **P0 — Критический** | Полная недоступность NSC/3D/AI, утечка данных, OT инцидент | NSC down, data breach, unauthorized OT access | 15 мин | 1 ч | CISO, Program Director, regulator | Немедленно |
| **P1 — Высокий** | Значительное ухудшение работы ключевых функций | AI не отвечает, Pixel Streaming падает, финансовый flow сломан | 30 мин | 4 ч | L3, Security Lead | В течение 1 ч |
| **P2 — Средний** | Частичная деградация, обходной путь есть | Медленные отчёты, отдельные виджеты не работают | 2 ч | 8 ч | L2 lead | Ежедневно |
| **P3 — Низкий** | Минорные дефекты, косметические | Опечатки, незначительные UI-глюки | 1 раб. день | 5 раб. дней | L2 | По факту |
| **P4 — Информационный** | Вопросы, обучение, запросы данных | «Как открыть отчёт?» | 1 раб. день | По плану | L1 | По требованию |

---

## 19.4. SLA/SLO/SLI

### 19.4.1. Service Level Indicators (SLI)

| Система | SLI | Измерение |
|---------|-----|-----------|
| NSC Web | Uptime | Процент доступности HTTP/HTTPS |
| NSC Web | Latency | Время ответа 95-го перцентиля |
| Unreal Pixel Streaming | FPS | ≥ 60 FPS в 95% времени |
| Unreal Pixel Streaming | Frame latency | ≤ 100 мс end-to-end |
| AI Agents | Time to first token | ≤ 3 с для 95% запросов |
| AI Agents | Full response | ≤ 15 с для ≤ 500 слов |
| OT Telemetry ingestion | Latency | ≤ 5 с для real-time class |
| Event Bus | Availability | 99.95% |
| Event Bus | Throughput | ≥ 100K events/sec |
| API Gateway | Availability | 99.99% |
| API Gateway | Error rate | ≤ 0.1% |
| Database | Availability | 99.99% |
| Backup | RPO | ≤ 15 мин для критических БД |
| Backup | RTO | ≤ 1 ч для NSC, ≤ 4 ч для 3D farm |

### 19.4.2. Service Level Objectives (SLO)

| SLO ID | Описание | Цель |
|--------|----------|------|
| SLO-01 | NSC uptime месяц | 99.95% |
| SLO-02 | Unreal streaming availability | 99.9% |
| SLO-03 | AI agents p95 latency | ≤ 3 s first token |
| SLO-04 | OT telemetry freshness | ≤ 5 s for 95% tags |
| SLO-05 | API error rate | ≤ 0.1% |
| SLO-06 | Critical incident MTTR | ≤ 1 ч |
| SLO-07 | Backup success rate | 100% |

### 19.4.3. Service Level Agreements (SLA)

- **SLA-01 — NSC/3D demo availability**: 99.9% during business hours, 99.5% otherwise, P0 MTTR 1 h.
- **SLA-02 — OT read-only telemetry**: 99.95% ingestion, latency ≤ 5 s, RPO 1 min.
- **SLA-03 — AI agents**: p95 ≤ 3 s, accuracy ≥ 90% for in-domain questions, fallback rate ≤ 5%.
- **SLA-04 — Data API**: 99.99% availability, p99 latency ≤ 200 ms.
- **SLA-05 — Security incidents**: P0 response 15 min, containment 1 h, recovery per IRP.

---

## 19.5. Мониторинг и наблюдаемость

### 19.5.1. Metrics

- Infrastructure: CPU, RAM, GPU, disk, network, temperature, power.
- Application: request rate, error rate, latency, saturation, throughput.
- 3D: FPS, frame time, Pixel Streaming bitrate, dropped frames, connected users.
- AI: token latency, hallucination rate, confidence, RAG recall, fallback rate.
- OT: tag count, data freshness, quality, alarm count, connection status.
- Security: failed logins, WAF blocks, SIEM alerts, vulnerabilities.
- Business: active users, reports generated, decisions logged, CBDC testnet tx.

### 19.5.2. Logs

- Centralized logging: JSON, structured, correlation ID.
- Retention: application logs — 90 дней, security logs — 1 год, audit logs — 7 лет.
- Sensitive data masked/tagged.

### 19.5.3. Traces

- OpenTelemetry tracing для всех сервисов и AI-вызовов.
- Distributed trace: от UI → API → DB → AI → OT adapter.

### 19.5.4. Alerting

- Alertmanager/PagerDuty for P0/P1.
- Escalation matrix: L1 → L2 → L3 → on-call manager → executive.
- Runbook attached to each alert.

---

## 19.6. Backup and Disaster Recovery

| Компонент | RPO | RTO | Стратегия |
|-----------|-----|-----|-----------|
| PostgreSQL/TimescaleDB | 15 мин | 1 ч | Streaming replication, daily backups, point-in-time recovery |
| Neo4j / Graph DB | 1 ч | 2 ч | Online backup, cluster replica |
| Kafka / Event Bus | 1 мин | 30 мин | Replication factor 3, mirror-maker / multi-region |
| Object Storage / MinIO | 15 мин | 2 ч | Cross-region replication, versioning |
| 3D Assets / Unreal Project | 24 ч | 4 ч | Git LFS + NAS/MinIO replication |
| AI Models / Prompts | 24 ч | 2 ч | Model registry + artifact repository |
| Config / IaC | 0 | 30 мин | Git, state in backend, automated restore |

---

## 19.7. Патчинг и обновления

- **OS/dependency patches**: критические — 24–72 ч, обычные — 2 недели.
- **Security patches**: критические — немедленно после тестирования, высокие — 48 ч.
- **Application releases**: CI/CD, blue/green или canary, automated rollback.
- **AI model updates**: shadow testing, A/B, guardrails review, approval by AI Council.
- **3D asset updates**: scheduled maintenance windows, versioning, regression test.

---

## 19.8. Capacity Management

- Прогнозирование нагрузки по событиям (министерские показы, инвест. форумы).
- Auto-scaling для API, AI inference, 3D rendering farm.
- GPU cluster: baseline + burst pools.
- Storage growth planning: telemetry retention policies, cold tier (S3 Glacier/MinIO cold).
- Network: QoS, reserved bandwidth for Pixel Streaming.

---

## 19.9. Документация эксплуатации

- Runbooks для каждого инцидента и alert.
- Architecture documentation (C4 diagrams, data model, API docs).
- Operational procedures: backup/restore, DR drill, patching, key rotation.
- User manuals per role (ministers, engineers, investors).
- FAQ и knowledge base.
- Training materials.

---

## 19.10. Post-Incident Review

Для P0/P1:
1. Timeline.
2. Root cause analysis (5 Whys /).
3. Impact assessment.
4. Remediation actions.
5. Lessons learned.
6. Update runbooks/IaC.
7. Communication to stakeholders.

---

## 19.11. Приёмка эксплуатационной модели

- Определены L1–L4, каналы, время реакции.
- Утверждены SLA/SLO/SLI.
- Развёрнут мониторинг, логирование, трейсинг, alerting.
- Проведён DR drill.
- Проведён security incident response drill.
- Документация и runbooks готовы.
- Обучена служба поддержки.
