Барлық мақалалар
RELIABILITY & AUTOMATIONFZM2026-09-257 мин оқу

Crash-safe automation: intent, checkpoint және blind retry-сіз қалпына келтіру

Автоматтандырудағы ең қауіпті жағдай — операцияның RED болуы емес, сыртқы күйдің өзгерген-өзгермегені белгісіз қалуы. Бұған durable intent, checkpoint және reconcile-before-retry көмектеседі.

1. Unknown state неге қауіпті Timeout операция орындалмады дегенді білдірмейді. Сервер ресурсты жасап үлгеруі мүмкін, бірақ жауап клиентке жетпей қалуы ықтимал. Соқыр қайталау әсерді екі рет орындауы мүмкін.

2. Мутация алдындағы durable intent Сыртқы әрекетке дейін операцияның мақсаты, ресурс идентификаторы және күтілетін нәтиже ұзақ сақталатын түрде жазылады.

3. Әр сыртқы әсерден кейін checkpoint Маңызды өзгерістен кейін жаңа checkpoint сақталады: не орындалды, қандай нұсқа белсенді, қандай тексерулер өтті. Осылайша recovery соңғы дәлелденген күйден басталады.

4. Retry алдында reconcile Timeout-тан кейін алдымен сыртқы күй оқылады: 1. Әсер қолданылған болса — келесі қадамға өту. 2. Әсер жоқ болса — қауіпсіз қайталау. 3. Күй қайшы болса — тоқтап, нақты шындықты қалпына келтіру.

Бұл тәсіл релиздерге, төлемдерге, кезектерге және ұзақ автоматтандырылған процестерге жарайды.

ЖОБАНЫ БАСТАУ

Сенімді цифрлық платформа құруға дайынсыз ба?

Техникалық талаптар мен жобаның жол картасын біздің инженерлік командамен талқылаңыз.