Архив рубрики ‘slo’

43 минуты в месяц. Как бюджет ошибок заканчивает спор о надёжности

Привет, Хабр! Спор повторяется в каждой компании, у которой есть прод. Инженеры говорят, что пора остановиться и заняться надёжностью. Продукт говорит, что квартальные цели горят и останавливаться нельзя. Побеждает тот, у кого выше должность, обе стороны расходятся недовольными, и через месяц всё повторяется слово в слово. Причина не в людях. Аргументы несопоставимые: одни говорят про риск, другие про выручку. Общей единицы нет. А пока её нет, […]

Нефункциональные требования: 5 ошибок, которые всплывут в проде

Всем привет, меня зовут Сергей Прощаев, и в этой статье расскажу про то, как системы, которые честно выполняют все заявленные функции, разваливаются под первой реальной нагрузкой — и почему корень проблемы чаще стоит искать не в коде, а в требованиях, которые никто не удосужился записать цифрами. Я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E‑commerce и преподаю на курсах разработки и архитектуры […]

Подход к оценке “живой” инфраструктуры и построению disaster recovery

И снова я говорю с Дмитрием, тимлидом нашей DevOps-команды. На этот раз мы поднимем тему процедур восстановления. Большинство проектов не имеют нормального плана восстановления после падений. Если план и присутствует, скорее всего, в нем покрыты не все кейсы, и часть из них, возможно, устарела. При этом задач на подготовку восстановительных процедур никто не ставит. Зато […]