按住说话,边说边出字。走基座 wss /v1/asr/stream,供应商 volc。
走基座 POST /v1/tts。播报纪律照抄 iOS:文本规范化 + 同句 10 秒去重 + 录音时自动停播。
说一句 → 识别 → 小乐回一句 → 播报出来。三次调用带同一个 X-Session-Id,控制台可按会话查成本。
/v1/chat/completions 首 token 就要 18~33 秒(已试过流式,无改善),
所以链路第 2 步会明显卡顿。这是基座侧问题,不是 ASR/TTS 的问题——
语音识别首字 0.8s、语音合成 0.4s 都正常。需要找基座团队查 chat 通道。
自签证书,浏览器会提示"不安全"——点「高级 → 继续访问」即可,麦克风必须 HTTPS 才能用。
令牌由服务端用设备激活码换取(1 小时自动续期),前端不持有任何密钥。