语音能力验证

连接中…

① 语音转文字(流式)

按住说话,边说边出字。走基座 wss /v1/asr/stream,供应商 volc。

识别结果会实时出现在这里…
首字延迟
总耗时
音频时长

② 语音播报(TTS)

走基座 POST /v1/tts。播报纪律照抄 iOS:文本规范化 + 同句 10 秒去重 + 录音时自动停播。

③ 完整链路联调

说一句 → 识别 → 小乐回一句 → 播报出来。三次调用带同一个 X-Session-Id,控制台可按会话查成本。

⚠️ 实测:基座 /v1/chat/completions 首 token 就要 18~33 秒(已试过流式,无改善), 所以链路第 2 步会明显卡顿。这是基座侧问题,不是 ASR/TTS 的问题—— 语音识别首字 0.8s、语音合成 0.4s 都正常。需要找基座团队查 chat 通道。
1 语音识别等待录音
2 小乐回答
3 语音播报

自签证书,浏览器会提示"不安全"——点「高级 → 继续访问」即可,麦克风必须 HTTPS 才能用。
令牌由服务端用设备激活码换取(1 小时自动续期),前端不持有任何密钥。