周栩丞 · ADEN ZHOU · 深圳 可远程
做 Agent,
也做它底下的推理。
比某一段做得多准更在意的,是整条链路在真实场景里能不能跑通,断掉之后还能不能续上。 这两年从模型底下的推理,往 Agent 这一层挪。
几个一直在用的判断
-
状态要有上界。
Agent 的可靠性问题最后都会落到这一条上:慢连接占着资源不放、解析抛了异常不把环境还原、长任务链走到一半断掉——都是同一类。上了界,链路才谈得上续跑。
-
一个数字如果可能从别处借来,就不该进报表。
统计口径比统计本身重要。口径不干净,后面的优化都是在拟合噪声。
-
让 Agent 写 kernel,难的不是写出来,是让它知道自己写的是不是对的。
所以在 kernel_opt_agent 上,力气大多花在证据和门禁上,不在生成上。
在做什么
自变量机器人
AI Agent 研发工程师 · 2026.03 — 至今
-
01
具身 Agent 闭环
在真实家庭场景里,把语音交互、意图理解、工具调用和动作执行接成一条任务长链。超时熔断和消息同步是为了让长链路不至于中途断掉。
华为 OD
软件开发工程师 · 大模型平台 · 2025.03 — 2026.03
-
02
推理服务
H100 上千亿参数模型跑起来,再把部署这件事从脚本变成流水线。做过 Q4 权重量化的显存布局、批处理调度和 KV Cache 调优。
-
03
模型平台
把训练、部署、评测放回同一条链路。做的事很杂,但目标只有一个:让每一次调整都有数据可依,而不是靠感觉。
开源
53 个已合并 PR,散在推理框架、KV Cache 传输、kernel 编译和一个自用的 kernel 优化工具上。
-
推理框架
vLLM 的多模态输入保留 DeepSeek 图像块的间距;lmdeploy 在环境变量解析出错后把
os.getenv还原;flash-linear-attention 里 RWKV7 低精度权重的正交初始化。 - KV Cache 传输 Mooncake 的池化 TCP 准入从按条数计改成按已排队字节数计,慢连接不再能把整个池拖住。
- Kernel 编译 TIRx-harness 里 ptxas 的资源统计限定在第一个 kernel report,不往后借后面的数字;CUDA 工具超时也改走正常的结果接口,而不是抛异常打断调用方的错误处理。
- 工具链 kernel_opt_agent 上累计 46 个已合并 PR。
背景
-
2023.02 — 2025.01
悉尼大学硕士 · 网络与分布式系统
-
2018.08 — 2022.12
宾夕法尼亚州立大学学士 · 计算机工程