IMMORTAL ← 回到首页

01 / AI INFRA & SPEECH

让声音,稳定地抵达。

这不是一份在线简历,而是一张工作脉络图:我怎样从图像算法走进语音系统,又怎样把模型能力变成可以持续运行、持续迭代的基础设施。

NOW / STEPFUN

把语音模型,放进真实的交互里。

从 2025 年 8 月起,我在 StepFun 做 AI Infra,围绕 StepAudio 系列负责语音推理服务。我的工作介于模型和线上系统之间:让能力被正确接入、编排和观测,也让它能够稳定地面对真实请求。

TTSVOICE OUT

让文字变成声音

围绕 StepAudio 系列,承接文本到语音能力的服务化与持续迭代。

ASRVOICE IN

让流式识别进入在线链路

处理语音输入、会话状态和推理服务之间的真实工程约束。

VADBOUNDARY

让系统听懂何时开始

为识别、对话和实时交互提供清晰、可靠的语音活动边界。

REALTIMESESSION

让能力进入持续交互

串联输入、推理与输出,把多个语音模块编排成一段完整会话。

CAREER TIMELINE

StepFun · AI Infra Engineer

围绕 StepAudio 系列负责 TTS、ASR、VAD 与 Realtime 等语音推理服务,从模型接入、服务编排到性能与稳定性,让语音能力进入可持续迭代的线上系统。

科大讯飞(上海)· 研究算法工程师

围绕多语种 TTS、音色转换和语音大模型,把算法工作延伸到流式推理、并发调度、低时延部署与端侧适配。也是在这里,我开始真正理解一项语音能力要经过多少工程环节才能抵达用户。

光鉴科技 · 图像算法工程师

从训练数据采集处理工具到人脸算法 SDK,参与图像流水线集成、性能分析和自动化验证。第一段职业经历让我看到,工具和流程本身也会决定算法团队迭代的速度。

电子科技大学 · 软件工程

以软件工程为起点,从 C/C++、Python 和系统基础出发,后来一路走到模型部署、推理服务与 AI Infra。

PROJECT SIGNAL × CORE STACK

技术不是清单,
是做过的事留下的路径。

项目先讲问题与系统,技术随后出现。这里只连接已经确认的核心关系;其他能力留在跨项目工程底座,不为画面完整而猜测归属。

ENGINEERING LENS

在模型和系统之间工作。

01END TO END

模型只是起点

真正的交付还包括协议、资源、调度、观测以及每一个失败边界。

02REALTIME

延迟是一整条链路

一次实时交互的体感,来自输入、分片、推理、编排和输出的总和。

03RELIABILITY

让失败可以被看见

比起隐藏错误,我更关心让边界、状态和异常变得可观测、可解释。

04EVOLUTION

给下一版模型留空间

好的基础设施不只服务今天,也要让明天的模型接入更快、迭代更轻。

这里聚焦适合公开的工程脉络:模型接入、服务编排、性能与稳定性。

看看技术思考 ↗