WRITING
文章
关于技术、工程和学习方法的长期记录。
置顶文章多模态流式推理还缺什么?
从 LPM 1.0 出发,讨论实时多模态推理在 KV Cache、时间线调度、增量预计算、打断恢复与多 Session 公平性上的系统缺口。
算力网络工程方法论全景图:从 GPU 拓扑到 MFU 的五层系统拆解
用物理链路、主机拓扑、RDMA 资源、流量控制和性能结果五层模型,串起 ECN、CNP、DCQCN、NCCL 与 MFU 的完整排障因果链。
为什么你的 RDMA 在容器里突然变慢?
从 NUMA、GPU-NIC PCIe 拓扑、SR-IOV、MTU、netns、cgroup 和多轨调度七个层面,排查容器化后 RDMA 与 NCCL 性能下降的问题。
为什么 AI 集群必须设计故障域?
从 GPU、NIC/Rail、Leaf、Spine、PFC/QoS、NCCL 通信组、推理服务和存储八个层面,解释 AI 集群如何限制局部故障的放大范围。
LPM 1.0 模型结构与推理加速:如何把 17B 视频 DiT 变成实时“数字演员”
从 Base LPM 的双音频交错注意力,到 Online LPM 的少步蒸馏、KV Cache、流水线与交互调度,系统拆解实时数字人的模型和推理架构。
Sol Video Inference Engine:面向高效视频生成的智能体原生全栈加速框架
详解 Sol-Engine 如何以 Agent-native 工作流组合跨步缓存、稀疏注意力、Token 剪枝、量化与 Kernel Fusion,实现视频扩散推理的全栈加速。
梁文锋投资者交流会:DeepSeek 的克制、AGI 路线与算力判断
提炼一场约 3 小时 44 分钟交流会录音中的核心观点:开源与商业化、AGI 路线、算力瓶颈、国产芯片机会和组织管理。
阿里大型生产级 AI 集群
从 ASI 超大规模 GPU 集群追踪出发,分析 GPU 碎片、IPC 去碎片、拓扑感知分配、SpotGPU 抢占调度与异构硬件挑战。