嗨,我是 Zekun Zhang 👋
Interested in DiT / Video Generation
这里放我的论文、随手写的 notes,以及一些我觉得酷的东西。 欢迎随便逛逛。
Papers
Selected publications
Mixture of Distributions Matters: Dynamic Sparse Attention for Efficient Video Diffusion Transformers
提出 MoD-DiT:利用早期去噪步骤中的先验信息进行动态稀疏注意力,通过两阶段流程与分布式混合方法,在保持生成质量的同时大幅降低视频扩散 Transformer 的计算开销。
RoPeSLR: 3D RoPE-driven Sparse-LowRank Attention for Efficient Diffusion Transformers
针对稀疏注意力在极端稀疏下破坏 3D RoPE 相对位置结构的“RoPE 困境”,提出 3D RoPE 引导的稀疏-低秩注意力框架;在超长视频推理上实现最高 10× 更低 FLOPs 与约 2.9× 端到端加速,同时保持近乎无损的生成质量。
ReasFlow: Assisting Reasoning-Centric Scientific Discovery in Applied Mathematics via a Knowledge-Based Multi-Agent System
面向应用数学的推理密集型科学发现,构建知识驱动的多智能体系统:以可审计的理论推理、自动化知识检索与自我改进机制,在单一系统内完成从理论推导到实证验证的全流程。