内部服务可能对上游业务提供了很多服务接口,当有一个接口跨公网调用第三方接口超时时,可能会导致所有接口都不可用,即使大部分接口不依赖于跨公网的第三方调用,也会如此。
为什么会出现这种情况呢?
内部服务对业务方提供的N个接口,会共用服务容器内的工作线程(假设有100个工作线程)。假设这N个接口的某个接口跨公网依赖于第三方的接口,发生了网络抖动,或者接口超时(不妨设超时时间为5秒,潜台词是,这个工作线程会被占用5秒钟,然后超时返回业务调用方);假设这个请求的吞吐量为20qps,(言下之意,很短的时间内,所有的100个工作线程都会被卡在这个第三方超时等待上,而其他N-1个原本没有问题的接口,也得不到工作线程处理),则潜在优化方案是什么?
·增大工作线程数(没有根本解决问题);
·降低超时时间(没有根本解决问题);
·垂直拆分,N个接口拆分成若干个服务,使得在出问题时,被牵连的接口尽可能少。(依旧没有根本解决问题,难道一个服务只提供一个接口吗?)