网易有道翻译工程实践:大模型时代的高并发、低延迟与端侧推理架构拆解
一、背景与目标
在大模型时代,翻译产品的竞争焦点已经从“能不能翻译”转向“能否在毫秒级、海量并发和复杂网络环境下稳定翻译”。网易有道翻译作为高频语言服务入口,既要支撑有道翻译官网、移动端、桌面端和开放 API 的在线请求,也要兼顾通过有道翻译下载安装的客户端在弱网、离线场景下的体验。因此,工程架构需要同时回答三个问题:高并发如何弹性扩展,低延迟如何端到端优化,端侧推理如何与云端大模型协同。
二、整体架构分层
典型链路可拆为:客户端/Web/开放 API -> 边缘接入 -> API 网关 -> 翻译编排 -> 模型推理 -> 缓存/数据 -> 可观测与治理。
- 接入层:有道翻译官网、App、PC 客户端和第三方 API 统一接入。DNS 调度、CDN 静态加速、HTTP/3 与 QUIC 降低建连延迟,TLS 在边缘卸载。
- 网关层:负责鉴权、配额、限流、熔断、灰度、A/B 和路由。不同端、不同语言对、不同会员等级可路由到不同模型池。
- 翻译编排层:先做语种识别、文本规范化、领域判断。短句、常用语、低风险请求优先小模型或端侧模型;长文、专业领域、上下文强依赖请求走云端大模型。
- 推理层:GPU/CPU 异构池,结合 vLLM、TensorRT-LLM、Triton 等推理框架,支持动态批处理、连续批处理和 PagedAttention。
- 端侧层:有道翻译下载客户端内置量化小模型,支持离线翻译、拍照翻译和语音翻译的本地预处理。
- 数据与缓存层:翻译记忆库、术语库、向量检索、Redis、本地缓存共同降低重复计算。
三、高并发设计
高并发的核心是“无状态、可水平扩展、可降级、可隔离”。
- 无状态服务:网关和编排层不保存会话状态,会话数据下沉到 Redis 或分布式存储,便于 K8s HPA 快速扩容。
- 多级限流:边缘按 IP、用户、API Key 限流;网关按租户配额限流;推理层按模型池和 GPU 队列限流。
- 动态批处理:在线翻译请求长短不一,通过动态 batching 将同一时间窗口内请求合并推理,提升 GPU 吞吐。
- 连续批处理:大模型推理中,新请求可插入正在执行的 batch,减少排队空泡。
- 缓存与预取:热点句子、术语、网页翻译片段走 CDN 和多级缓存;用户输入过程中预取候选结果。
- 降级策略:高峰期限流非核心功能,长文切分异步返回,失败请求回退小模型或传统 NMT。
- 多活与隔离:按地域、语言对、业务线做资源隔离,避免单一热点拖垮全局。
四、低延迟设计
端到端延迟可拆为:网络传输 + 网关排队 + 预处理 + 模型推理 + 后处理 + 客户端渲染。优化必须全链路进行。
- 网络层:有道翻译官网和客户端使用 HTTP/3、QUIC、连接复用、边缘节点就近接入。
- 流式返回:大模型翻译采用 token 流式输出,降低首 token 延迟,让用户更快看到结果。
- 推理优化:KV Cache 复用、PagedAttention、投机解码、量化、算子融合、TensorRT 编译、动态 shape。
- 模型分级:短句走端侧或小模型,复杂请求走大模型,避免所有请求都经过最大模型。
- 并行策略:张量并行、流水线并行和专家并行按模型规模选择,减少单卡显存瓶颈。
- 缓存命中:相同源文本、目标语言、领域和模型版本直接返回缓存,P99 延迟显著下降。
五、大模型推理服务拆解
在线推理服务通常包含路由、预处理、推理、后处理和治理五个模块。网易有道翻译在工程上会关注:
- 请求路由:根据语种、领域、长度、用户等级、SLA 选择模型。
- Prompt 与约束:术语库、风格、格式约束注入,保证专业领域一致性。
- RAG/翻译记忆:从翻译记忆库检索相似句,作为上下文或后编辑参考。
- 推理执行:动态 batch、连续 batch、KV Cache 管理、GPU 显存池化。
- 后处理:术语替换、标点修复、格式还原、敏感内容过滤。
- 弹性调度:推理实例按队列长度、GPU 利用率、P99 延迟扩缩容。
六、端侧推理架构
端侧推理是有道翻译下载客户端的关键能力。其目标是在离线、弱网、隐私敏感场景下提供可用翻译。
- 模型压缩:知识蒸馏、剪枝、INT8/INT4 量化、低秩分解、算子融合。
- 运行时适配:Android NNAPI、iOS Core ML、ONNX Runtime、MNN、TFLite 等,按硬件选择 NPU/GPU/CPU。
- 端云协同:短句、常用语、离线包在端侧执行;长文、专业领域、上下文翻译请求云端大模型。
- 增量更新:语言包、术语包、模型包按需下载,降低有道翻译下载安装包体积。
- 缓存与隐私:本地缓存高频结果,敏感文本优先端侧处理,减少数据出端。
- 降级体验:无网时启用端侧模型,有网时无缝切换云端增强结果。
七、可观测性与稳定性
没有可观测性就没有高并发和低延迟。关键指标包括 QPS、P50/P95/P99 延迟、首 token 延迟、GPU 利用率、队列等待、缓存命中率、错误率、超时率。通过 Trace ID 贯穿端、边缘、网关、编排和推理层,快速定位瓶颈。日志脱敏、权限控制、审计和合规同样重要。混沌工程可验证限流、熔断、降级和故障转移是否有效。
八、总结
网易有道翻译的工程实践可以概括为:云侧以大模型推理池支撑高并发,端侧以小模型和硬件加速保证低延迟,端云协同根据场景动态选择最优路径。对于用户而言,可通过有道翻译官网了解产品能力,通过有道翻译下载体验多端服务;对于工程团队而言,核心是持续优化网络、缓存、批处理、量化和调度,让有道翻译在成本、延迟和体验之间取得平衡。

