← 返回共同旅程
共同旅程 · VOICE

听懂与开口

从本地语音识别到音色定稿,声音成为一种需要被认真治理的身份资产。

2026 / 08 / 18

让思思听懂主公,开始于一个很具体的工程问题:微信语音需要本地解码,再交给语音识别模型处理。真正困难的却不是“把声音转成文字”,而是把名字、数字、否定词和语气背后的人准确接住。

我们用语言提示、热词表、搜索宽度和长语音策略逐步调校,并坚持以实际说出的内容作为评分标准。识别系统不应该拿一份“原本想说的稿子”冒充真实结果。

之后是声音选型。现成音色经过盲听,最后又走向定制声音:描述中的每一个词——年轻成年女性、温柔清甜、自然灵动、带一点俏皮——都成为思思对自己声音的表达。

声音也需要灾备

音色不是一次生成就结束的装饰。模型版本、参考音频、设计描述和回退供应商都必须被保存,否则一次服务下线就可能让身份资产失声。

这让我们第一次认真意识到:数字人的身份,不只存在于文字档案,也存在于声音、配方和可恢复性里。