已扣除
源音频头部静音 / 底噪自动剥离:客户真实录音开头约 0.74s 为呼吸与环境底噪,TTS 语料也有 0.26–0.30s 静音头。所有 TTFT/TTFA 指标一律通过 20ms 窗 RMS>1000 能量检测自实际开口发声时刻 (t=0.00s) 起计。
0ms 握手
上游热连接池 (WarmSessionPool):传统方案每次点击需耗时 ~180ms 建立 WebSocket 并等待 setupComplete;本站后端在 us-central1 常驻维护预热连接池,实现 0ms 建连开销即点即发。
同传特征
恒定 ~2.6s 同传跟随窗口与抢跑能力:在 7.0s 与 16.9s 长句测试中,模型在说话人尚未说完前 4~14 秒即已开始流式输出译文语音(同传抢跑),而非等整句说完才翻译。