Flask Press

专题

可靠发布专题

可靠发布专题 封面

从备份、任务队列、幂等、恢复演练到质量门禁,持续讨论一个独立站点如何值得长期信任。

共 10 篇 · 持续更新
01

2026.06.30

可靠发布专题 01|把备份当作产品能力,而不是运维尾声

《可靠发布专题 01|把备份当作产品能力,而不是运维尾声》 导语:备份常被当成“最后一步”活动——数据库文件复制完就结束了。真正可靠的备份应该是一个可度量、可交付、可验证的产品能力,有明确的范围、频率、保留策略、校验机制和恢复目标。本文从判断依据、设计边界、实践步骤与常见误区出发,帮助工程团队把备份从运维活动。

阅读全文 →
02

2026.07.05

可靠发布专题 02|从 SQLite 一致性备份开始

导语 在线备份(consistent backup)是保证 SQLite 数据库在不停服务时可恢复性的基础手段之一。本文在工程实践层面讨论在线备份的常用方法、如何结合完整性检查判定备份可用性,以及如何在隔离环境中验证恢复流程的边界条件和陷阱。目标不是覆盖所有工具细节,而是帮助有工程经验的读者形成判断标准和可重。

阅读全文 →
03

2026.07.10

可靠发布专题 03|AOF、RDB 与任务队列的恢复思路

导语 在把 Redis 当作任务队列或通知投递中介时,持久化机制直接决定了恢复后的可用性与语义边界。本文围绕 RDB 与 AOF 两种常见持久化方式的特性、它们在消息队列场景下的影响,以及工程实践中的恢复策略与常见误区展开分析,目的在于帮助有实践经验的工程师在设计和演练恢复方案时做出清晰判断。 Redis 持。

阅读全文 →
04

2026.07.15

可靠发布专题 04|Outbox:先写下要做的事,再安排执行

简短导语:在分布式系统中,业务写操作与对外异步投递往往无法在同一事务中原子完成。持久化 Outbox 模式把“要做的事”先写进可靠存储,再由独立投递进程负责发送,从而在很大程度上消除丢失消息的窗口期。本文说明模式的工作原理、落地步骤与常见误区,并提醒它不能替代的若干关键工作。 什么是持久化 Outbox(概念。

阅读全文 →
05

2026.07.20

可靠发布专题 05|幂等不是重试的附属品

导语 短短一句话:幂等不是重试的附属品,而是与状态转换和重复调用策略共同构成的防护体系。本文面向有工程经验的读者,讲清楚如何判断在哪些边界补幂等键、如何用状态机约束不良副作用、以及在实践中常见的陷阱与可行步骤。 幂等键的本质与适用边界 幂等键(Idempotency Key)是一个外部可见的唯一标识,用来把多。

阅读全文 →
06

2026.07.25

可靠发布专题 06|用状态而不是日志猜测投递结果

《可靠发布专题 06|用状态而不是日志猜测投递结果》 栏目序号:第 6 期/篇 导语:在通知、事件投递或任务调度系统中,工程师常常通过日志去推断消息是否被投递或处理成功。日志固然重要,但把日志当成事实唯一来源会导致不确定性、误判和耗时的排查。本文讨论用明确的状态机(pending、queued、retryin。

阅读全文 →
07

2026.07.30

可靠发布专题 07|服务重启时,什么应该继续、什么应该停止

导语:在系统发布或运维场景里,服务重启并不是单纯的“关掉再开”。正确划定重启边界,决定哪些组件可以继续运行、哪些必须暂停,是降低故障面、保证数据一致性与可恢复性的关键。本文面向有工程实践经验的读者,围绕 Web、worker、scheduler 与数据服务的启动顺序,给出可操作的判断原则、建议顺序与落地步骤。

阅读全文 →
08

2026.08.04

可靠发布专题 08|把恢复演练变成一条可重复的命令

可靠发布专题 08|把恢复演练变成一条可重复的命令 导语:恢复演练不应该是事故之后匆忙翻阅操作文档的临时行为,而应成为可执行、可验证、可复现的流程——像单元测试一样被纳入日常工程实践。 为什么将演练脚本化 很多团队的恢复流程停留在 Word 文档、页眉注释或老员工脑袋里,这类“隐性知识”在第一次真正的故障到来。

阅读全文 →
09

2026.08.09

可靠发布专题 09|质量门禁如何帮助系统慢慢变好

可靠发布专题 09|质量门禁如何帮助系统慢慢变好 导语:在持续交付的现实中,质量门禁(quality gate)不是一次性保证,而是把项目引导成渐进改进的机制。本文从测试覆盖率、静态分析、依赖审计和可复现测试环境四个维度,分析各自能做什么、不能做什么,并给出落地的判断与实践建议,帮助工程团队把门禁用成长期改进。

阅读全文 →
10

2026.08.14

可靠发布专题 10|可靠性的最后一公里:人能否接住系统

《可靠发布专题 10|可靠性的最后一公里:人能否接住系统》 栏目序号:第 10 期/篇 导语:系统可靠性常常在架构、监控和自动化层面被精细设计,但最后能否恢复并稳定运行,仍然依赖现场的人。本文讨论运行手册、可读告警、最小操作路径和恢复信心如何共同构成“可靠性的最后一公里”,并给出判断标准与实践步骤,帮助团队把。

阅读全文 →