让文字变成声音
围绕 StepAudio 系列,承接文本到语音能力的服务化与持续迭代。
01 / AI INFRA & SPEECH
这不是一份在线简历,而是一张工作脉络图:我怎样从图像算法走进语音系统,又怎样把模型能力变成可以持续运行、持续迭代的基础设施。
NOW / STEPFUN
从 2025 年 8 月起,我在 StepFun 做 AI Infra,围绕 StepAudio 系列负责语音推理服务。我的工作介于模型和线上系统之间:让能力被正确接入、编排和观测,也让它能够稳定地面对真实请求。
围绕 StepAudio 系列,承接文本到语音能力的服务化与持续迭代。
处理语音输入、会话状态和推理服务之间的真实工程约束。
为识别、对话和实时交互提供清晰、可靠的语音活动边界。
串联输入、推理与输出,把多个语音模块编排成一段完整会话。
CAREER TIMELINE
围绕 StepAudio 系列负责 TTS、ASR、VAD 与 Realtime 等语音推理服务,从模型接入、服务编排到性能与稳定性,让语音能力进入可持续迭代的线上系统。
围绕多语种 TTS、音色转换和语音大模型,把算法工作延伸到流式推理、并发调度、低时延部署与端侧适配。也是在这里,我开始真正理解一项语音能力要经过多少工程环节才能抵达用户。
从训练数据采集处理工具到人脸算法 SDK,参与图像流水线集成、性能分析和自动化验证。第一段职业经历让我看到,工具和流程本身也会决定算法团队迭代的速度。
以软件工程为起点,从 C/C++、Python 和系统基础出发,后来一路走到模型部署、推理服务与 AI Infra。
PROJECT SIGNAL × CORE STACK
项目先讲问题与系统,技术随后出现。这里只连接已经确认的核心关系;其他能力留在跨项目工程底座,不为画面完整而猜测归属。
ENGINEERING LENS
真正的交付还包括协议、资源、调度、观测以及每一个失败边界。
一次实时交互的体感,来自输入、分片、推理、编排和输出的总和。
比起隐藏错误,我更关心让边界、状态和异常变得可观测、可解释。
好的基础设施不只服务今天,也要让明天的模型接入更快、迭代更轻。
这里聚焦适合公开的工程脉络:模型接入、服务编排、性能与稳定性。
看看技术思考 ↗