Open to opportunities · 上海嘉定

李龙飞
把系统性能
变成可验证的数字

$

自动驾驶 中间件与 SIL 仿真框架 工程师,正在向 AI Infra 延伸。 从零主导 MFF 多域并行状态机仿真框架3 域并行 · 190+ 状态节点 / 95%+ 状态覆盖), 手写无锁通信总线与 C++20 协程调度底座,并独立实现了 LLM 推理调度器训练并行调度内核

95%+
状态机覆盖率
3
并行状态机架构
152ns
总线 P50 延迟
2.9×
LLM 生成提速
40×
协程吞吐提升
01 — SKILLS

技术栈

主线是 C++ 高性能编程与车载系统,近半年延伸到 LLM 系统方向 —— 两条线共用同一套"先量化、再优化"的方法论。

C++ 核心与高性能编程

精通 Modern C++(11/14/17/20),熟练模板元编程、可变参数模板、RAII 与智能指针; 深入 C++20 协程无锁并发(无锁队列、seqlock、原子操作、内存屏障)、动态内存池与零拷贝优化。

C++20 CoroutinesLock-freeseqlock memory barrierTMPzero-copy

自动驾驶中间件与系统

从零自研轻量级高性能自动驾驶中间件;熟悉 Pub/Sub 消息总线设计、 多模式任务调度器(优先级轮询 / Choreo 数据流触发)、IPC 共享内存与跨机 TCP 通信; 深入理解车载数据链路、QoS 策略与全链路可观测性。

Pub/Sub busshared memoryQoS schedulerobservability

智驾算法与仿真验证

熟悉规控与感知核心算法(EKF 多源融合、ST 图 DP 规划、Piecewise-Jerk 带状 QP、LTV MPC 轨迹跟踪); 熟练搭建 MFF 多域并行状态机 SIL/HIL 仿真闭环框架、并发仿真引擎与场景评估系统; 掌握状态机静态分析、迁移追踪、守卫覆盖与不变式验证。

EKFST-DPPiecewise-Jerk QP LTV MPCSIL/HILMFF

AI Infra · LLM 系统

NEW

独立实现 LLM 推理调度内核(Paged KV / 连续批处理 / 前缀缓存 / DeepSeek MLA / 投机解码) 与 训练并行调度内核(DP / 张量并行 / 流水线并行 / 异步 1F1B)。 CUDA 侧手写 PTX GEMM kernel,用 位级对账(bit-parity)验证并行策略的正确性。

PagedAttentionContinuous BatchingMLA Speculative DecodingDP/TP/PP CUDA PTXbit-parity
02 — EXPERIENCE

工作经历

从集成调优到平台研发,做的一直是"让系统在真实约束下跑得对且跑得快"。

智己汽车科技 仿真开发工程师 NOW 2026.06 — 至今
C++ · Python · SIL/HIL · 多域并行状态机 · 并发调度 · CI/CD · 前端可视化
  • MFF 多域并行状态机 SIL 仿真框架(IMFL)从零设计与搭建:独立设计 主域 / APA 泊车域 / IBS 车身域 三域并行状态机架构,纳管 190+ 状态节点,构建「可达性分析 → 迁移追踪 → 守卫覆盖(MC/DC)→ 扰动注入 → 不变式断言」的完整验证链路,状态覆盖率达 95%+,实现 SIL 环境下全自动化逻辑验证与回归。
  • 高并发执行与确定性保障:设计多场景高并发执行机制,针对时序竞态引入串行确定性兜底;场景库扩充至 1000+,12 并发下约 40min 跑完全量回归,集群模式缩短至 10min
  • 自动化编译与 CI/CD 流水线:端到端构建测试流水线,构建时长由手动约 15min 缩短至自动触发 5min 内,日均支持 20+ 次自动化回归。
  • 分层部署架构优化:"大包(基础运行环境)+ 小包(独立业务模块)"分层部署,统一多平台运行环境,单次部署包体积从 7GB 优化至 400MB(约 18 倍)
  • 全链路可观测与可视化闭环:构建"编译 → 仿真 → 评估 → 报告展示"完整闭环,测试报告 100% 自动化生成,失败 Case 快速定位。
魔门塔(Momenta) R&D Engineer 2025.03 — 2026.03
C++11 · QNX / Linux · Protocol Buffers · CMake · obf-cm 通信中间件
  • 车端状态监控模块研发:支持导航辅助、自动泊车、车道保持等多项高阶智驾功能的数据采集与异常监控;负责新人与实习生技术指导。
  • 多平台适配与系统部署:完成面向 QNX 与 Linux 多操作系统的系统适配与量产车型部署,保障车端服务高可用与低资源占用。
  • 性能与流量优化:采用"车端二进制紧凑存储 + 云端后验解析"方案,大幅降低车载网络带宽消耗与存储开销。
  • 日志与数据闭环系统:设计高吞吐大文件日志切片系统,实现 300s 自动切片与实时数据导出;配置化架构支持 20+ 功能开关热插拔,累计支持数十万台量产车辆数据采集与闭环。
卓驭科技(大疆车载) 集成与调试调优工程师 2024.07 — 2025.03
C++11 · CMake · Conan · perf / gperf / qperf · ccache+pch · QNX / Orin / Qualcomm
  • 系统负载 Profile 与优化:针对成行平台在低算力芯片(高通 / Orin)上的稳定性要求,用 perf / gperf / qperf 定位定位与地图模块的 CPU / 内存瓶颈,完成针对性优化以满足算力约束。
  • 构建系统重构与 CI 建设:参与定位与地图上车代码仓库构建体系设计,引入 CMake + Conan 依赖管理;作为 CI 虚拟组核心成员完成代码库全自动化流水线接入。
  • 多车型与硬件平台适配:针对不同量产车型及芯片平台进行底层适配与软件配置裁剪;设计 QNX 负载控制压测工具,引入 ccache+pch 显著提升编译速度。
深圳软牛科技集团 C++ / Qt 开发工程师 2023.09 — 2024.06 · 实习
C++11 · Qt5 / QtWidgets · QSS · QThread · Crypto++ · 网络通信
  • 桌面工具软件端到端研发:参与创业事业部核心桌面工具软件(系统实用工具 / 多媒体处理类)的敏捷孵化与迭代,负责客户端模块化架构搭建与业务逻辑开发。
  • 通用 UI 组件库:基于 Qt Widgets 与 QSS 封装通用无边框窗口、高重用度自定义控件及换肤组件,统一客户端视觉规范。
  • 多线程异步模型:用 QThread 与事件分发机制将耗时文件 IO、大任务批处理与 UI 主线程完全解耦,消除界面卡顿。
  • 数据安全与网络协议:设计客户端与云端 API 交互层,结合 Crypto++ 实现核心传输协议与本地配置数据的加密防篡改。
03 — OPEN SOURCE

开源项目

六个仓库,一条主线:把性能约束变成可复现、可对账的实测数字。近期的两个 LLM 系统项目正在把这条线延伸到 AI Infra。

◆ AI INFRA · LLM SYSTEMS
/ FlowServe NEW C++Python github.com/caixuf/flowserve ↗

LLM 推理调度器 —— 从零手写 vLLM 的核心调度机制:分块 KV 管理、连续批处理、前缀缓存、DeepSeek MLA 潜空间压缩与投机解码。挂在 flowcoro 旁边的独立推理仓,不改动 flowcoro 本身。

  • 核心组件BlockManager(分块 KV 管理)/ Scheduler(连续批处理)/ Engine(引擎主循环),外加 nn::{RoPE, MLA, Speculative} 算子层。
  • 移植自 kun-cellular:多头低秩潜空间注意力(DeepSeek MLA)与投机解码,实现跨项目的算法复用。
  • 不是玩具:内置 Byte-level Tokenizer(词表 259 = 3 特殊标记 + 256 单字节,零 OOV)与真实多层 MLA Transformer 前向,配 404KB 真实预训练权重。
  • 可交互chat_cli 逐字流式生成 + Web 对话界面,非静态 demo。
实测 · n=64 prompt=32 gen=16 max_seqs=8 · 调度层基准用合成负载
配置peak KV 块TTFT (μs)TPOT (μs)
full(paged+cont+prefix)2416728323
no_paged(预留 max_len)4816728323
+ mla_latent_kv816728323
+ speculative_decoding255745112
+ modern_stack (mla+spec)85745112
  • MLA 显存压缩:KV 峰值块 24 → 8,显存占块降至原来的 1/3。
  • 投机批处理加速:TTFT 下降 65.6%,TPOT 323μs → 112μs,生成提速近 3 倍
  • Paged vs naive:峰值块数减半(48 → 24),前缀缓存命中可测(94 hits)。
  • 调度器不改动底座:全部机制在推理仓内自洽实现,FlowCoro 仅作为调度底座被复用 —— 用同一套协程运行时同时驱动车规管线与 LLM 推理。
/ FlowTrain NEW C++Python github.com/caixuf/flowtrain ↗

分布式训练并行调度内核 —— 从零手写 DP / 张量并行 / 流水线并行三套并行策略,把「与单进程参考逐 bit 全等」当作唯一的正确性验收线。

  • 位级对账(bit-parity):所有并行切分都要求与单进程参考逐 float 相等 —— 排除了浮点累加顺序的解释空间,这是分布式训练里最硬的正确性标准。
  • 异步 1F1B 流水线:接入 FlowCoro 协程运行时,跨 Stage 用 BoundedChannel(容量 2)做流量控制与反压,通道满/空走 co_await flowcoro::yield() 协程级让出,消灭线程自旋。
  • GPU 侧真发射:手写 PTX 9.0 汇编 GEMM kernel,经 CUDA Driver API 动态 JIT 装载;严格用 mul.rn.f32 + add.rn.f32 分步舍入规避 FMA 单次舍入漂移,输出与 CPU 参考逐 bit 全等
  • 门禁锁死require_gpu=true 禁止静默降级到 CPU;用硬件发射计数核准(gpu_launches=64/64)证明真在 GPU 核上跑了。
  • 全 Stage 独立 Stream:每 Stage 独占 CudaStream + Pinned DMA 往返,解除全局互斥锁。
DP
bit_id = 1
shard dW 相加后 SGD,与单进程权重逐 float 相等
TP
bit_id = 1
列切开 + allgather(Y_r) vs 完整 X@W
TP · MLA
bit_id = 1
W_uv 列切多头 + W_o 行切归约
PP · async
grads_bit = 1
dW 按 mb 保序归约,GPU 发射 64/64
  • 1F1B vs GPipe:峰值未回传激活 10 vs 32;同时诚实标注 —— Tf=Tb 且 M 不大时不保证 1F1B makespan 更短(span 236 vs 226)。
  • 明确边界:反向计算仍在 CPU、进程组为单机多线程模拟(非 NCCL)、PTX 指定 sm_75 通用 ISA。README 里逐条写清了未做项。
◎ 自动驾驶 · 系统与中间件
/ KunAutoDrive C11C++20 github.com/caixuf/kunautodrive ↗

仿真优先的自动驾驶中间件与 ADAS 算法闭环平台。从零独立研发,包含无锁通信总线、协程调度、多传感器融合、轨迹规划与控制全流程。

  • 通信与调度层:手写无锁 Pub/Sub 消息总线(分片分发 + seqlock 订阅表 + 零拷贝内存池),实测 P50 152ns / P99 179ns
  • 算法闭环:基于协程节点串联 EKF 多源融合、8 状态行为决策状态机、ST 图 DP 速度规划 + Piecewise-Jerk 带状 QP 轨迹规划、PID / Stanley / LTV MPC 跟踪控制与 TTC/MRM 安全闸门。
  • 仿真与工具链:配套自研仿真引擎、FlowBoard 3D 可视化仪表盘及 MCAP/bag 记录回放,支持跨进程分布式多场景回归评估。
  • 质量体系:CTest 29/29 全绿 · CI · ASan 内存检查 · Docker 化运行环境;异常注入鲁棒性实测,AEB 避险成功率 100%(仿真闭环评估结果)。

面向车载高并发交互与资源受限场景自研的现代 C++20 协程库与并发调度框架。已作为 KunAutoDrive 车规管线与 FlowTrain 异步流水线的调度底座。

实测 · GCC 13.3.0 Release · 24 线程
场景方案吞吐平均延迟
阻塞 IO · 2000 请求线程池7,220 RPS138.5 μs
阻塞 IO · 2000 请求FlowCoro 协程285,714 RPS3.5 μs
高并发 · 10 万请求thread-per-request31,655 RPS34.9 MB 内存
高并发 · 10 万请求FlowCoro 协程16,666,667 RPS11.5 MB 内存
  • 吞吐 ~40x,延迟降两个数量级 —— 挂起不占线程,阻塞等待零线程浪费。
  • 工作窃取调度器:多线程 Work-Stealing 机制均衡多核负载,消除任务饥饿。
  • 精细化内存管理:动态内存池与对象缓存复用,避免内存碎片与频繁分配开销。
  • 基准测试:无锁环形队列与跨进程 Benchmark,协程创建开销中位数 105 ns

软件定义硅基细胞计算机(SDSCC)—— 一次偏执的跨领域实验:把图灵形态发生、Kahn 拓扑编译与 NEAT 拓扑演化,塞进一个纯 C11、零 GC 的可计算皮层。FlowServe 的 MLA 与投机解码正是移植自这里。

  • 24 种算存一体细胞原语,配合 3D 兰纳-琼斯力场驱动的形态发生过程。
  • Kahn 拓扑编译:将数据流图编译为确定性可执行的细胞网络。
  • 纯 C11 零 GC 皮层导出,单步耗时 19.06 ns
  • 已嵌入 FlowEngine 生产管线跑车规闭环 —— 这是个实验,但它真的在跑。
04 — HONORS

荣誉 & 认证

蓝桥杯 C++ 软件开发大学组第十三届 · 全国三等奖
国家级
软件设计师(中级)全国计算机技术与软件专业技术资格(软考)
资格认证
蓝桥杯 Java 大学组第十五届 · 贵州省二等奖
省级
蓝桥杯 C/C++ 大学 A 组第十四届 · 贵州省三等奖
省级
05 — EDUCATION

教育背景

贵州大学明德学院

本科 · 土木工程 · 2020.09 — 2024.06

大一起自主系统修读计算机专业核心课程:操作系统、计算机网络、数据结构与算法、编译原理等,具备扎实的底层计算机系统功底与编程能力。

关于"非科班":
专业课表上写的是土木,但真正花时间的地方在另一边。没有老师、没有实验室,只有编译器、文档和一堆写坏的代码 —— 这条路慢,但每一层都是自己踩实的。

聊聊中间件、AI Infra,或者别的

对自动驾驶工具链、C++ 高性能编程、LLM 推理与训练系统有兴趣 —— 随时找我。