1. 概述

a. Megatron

  • Buffer 的创建,这个部分需要提前创建出来对称内存提供给permute+layout部分使用。
  • permute+layout部分的流程为token dispatcher + fuse_a2a

b. NCCL4PY

  • 涉及内存alloc和vccl alltoallv的c++接口怎么直接给上层使用 nccl4py

c. VCCL

d. VCCL Document

2. timeline

  • 过一遍当前进度,弄清楚现在的buffer设计:vccl moe in feishu 🛫 2026-01-14 ✅ 2026-01-15
  • 增加alltoallv接口,修改sendcounts/recvcounts为指针,增加relay_buffer和它的长度,直接使用nccl4py调用,设计开发测试 🛫 2026-01-15 ✅ 2026-01-16
  • layout部分完成input/output split正确写到sendcounts/recvcounts内,第一行保存每个rank自己在input buffer的长度,第二行保存每个rank自己在input buffer上的开始地址。 ✅ 2026-01-16
  • taskAppend to planne 🛫 2026-01-19
  • scheduleRmaTaskToPlan调度:1234(signal) 5(signal)6(signal)7(signal)