本文详细记录了一个关于GET接口不定期报“参数不存在”错误的问题排查过程。该问题表现为请求参数偶尔缺失,但重试后恢复正常。通过逐步排查,定位到问题发生在Spring框架绑定参数阶段,具体是由于Tomcat连接器复用导致的参数解析状态被污染。文章介绍了如何通过编写最小化复现代码和调整系统配置来稳定复现这一偶发问题,并提出了两种解决方案:一种是从根本上避免异步线程中使用`HttpServletRequest`等对象,另一种是在拦截器层面实现兜底机制,自动检测并重新解析参数。此外,还总结了几条编码建议以帮助开发者避免类似问题。
本文详细介绍了如何解决RabbitMQ消费者“假死”问题的经验。作者首先描述了线上遇到的挑战,如TCP连接被防火墙静默丢弃导致消息积压,以及在多实例环境中如何避免故障扩散。为了解决这些问题,团队开发了一套客户端自愈机制,包括消费者守护、双MQ实例与配置热刷新、生产/消费缓存等五个关键部分。其中,消费者守护通过三级健康检查和反射重建技术确保即使在网络不稳定或配置变更时也能自动恢复消费者;同时,实现了跨实例的隔离恢复策略,防止一个实例的问题影响到其他正常运行的实例。此外,还讨论了手动ACK处理、资源全生命周期管理等细节,强调了配置热更新、精准级联恢复的重要性。这套方案不仅提高了系统的稳定性和可用性,也为其他项目提供了可借鉴的经验。
本文详细分析了在可重复读(RR)隔离级别下,MySQL 中因并发执行“先 delete 再 insert”操作导致的死锁问题。具体场景为多个线程对同一张表按某个索引字段先删除旧记录、再插入新记录,且删除的键值可能不存在。文章通过简化模型重现了这一死锁现象,并解释了其背后的原因:删除不存在的记录时,InnoDB 会加间隙锁防止幻读;而两个事务同时持有同一段间隙的间隙锁并尝试插入数据时,由于插入意向锁与已存在的间隙锁冲突,导致双方互相等待,形成死锁。文章还提供了四种解决方案,包括先查后删、使用 upsert 语句、降低隔离级别以及控制并发等,并给出了排查死锁日志的具体步骤和技巧。