目录
summer-camp-2026
TileOPs-Metax Logo

TileOPs-Metax

面向大语言模型、由规范驱动的 GPU 算子库

简体中文 | English

项目状态:TileOPs-Metax 正在积极开发中,API 可能发生变化。

开源英才夏令营与线上实践

本仓库同时支持首届开源英才夏令营线下任务和国产 GPU 高性能算子纯线上实践。两种参与形式共同遵循TileLang 算子性能分析与优化指南中的技术交付与验收要求,并与夏令营开营前的线上课程和线上作业相互独立。

参与形式 定位 组织方式 完成标志
开营前线上课程与作业 入营前的基础学习和准备 按原课程及作业安排完成 完成课程和作业,不等同于完成线下任务或线上实践
夏令营线下任务 首届夏令营现场项目实践 小组协作、助教指导和成果答辩 达到线下任务要求并参加答辩
国产 GPU 高性能算子线上实践 线下课程与项目任务开放后的个人开源实践 创建认领 Issue,按照指南向本仓库提交 PR,由一名仓库管理员负责确认、Review 和结业核验 完成指定课程、相关 PR 合入,并在原认领 Issue 中申请线上结业证书

开营前线上课程与作业由原课程平台单独维护,本仓库不提供其入口。

国产 GPU 高性能算子线上实践

线上参与者遵循TileLang 算子性能分析与优化指南中的技术交付与验收要求;固定日期、小组、助教、现场答辩和优秀项目评选仅适用于线下夏令营。纯线上参与按以下流程完成:

  1. 学习管理员后续公布的指定课程录像;
  2. 参照线上算子认领登记 Issue #21创建认领 Issue,并等待管理员确认;
  3. 按照指南完成任务,参照纯线上 PR 提交前检查 Issue #22完成自查,向本仓库提交 PR,并关联认领 Issue;
  4. 相关 PR 通过 Review 并合入后,在原认领 Issue 中附课程完成记录和已合入 PR 链接,联系管理员申请线上结业证书

夏令营线下任务(8/3-8/7)

夏令营学员应使用 summer-camp-2026 分支,并遵循TileLang 算子性能分析与优化指南

学员以小组为单位,从筹备组发布的候选算子清单中选择一个主算子。候选算子主要来源于 MetaX-MACA/TileKernels-Metaxdev 分支,并已初步评估 MetaX C500 适配或性能优化空间。学员需要按照 TileOPs 的接口和工程规范完成算子泛化、MetaX C500 适配、测试验证和性能分析与优化,而不是简单复制源实现:

  1. 认领算子并提交 Manifest;
  2. 完成 Op、TileLang Kernel、正确性及边界测试;
  3. 在真实 MetaX C500 上完成正确性验证、Benchmark、Profiler 和 Roofline 分析;
  4. 提交可 Review 的实现 PR,并参加成果答辩。

完整时间安排、提交要求和验收标准见TileLang 算子性能分析与优化指南

可认领范围以筹备组发布的候选算子清单为准,源仓库中的算子不会默认全部开放认领。每组应优先选择一个中等或较高难度的主算子;在保证主算子完整交付并经助教确认后,最多可追加两个算子。每个算子须单独认领并分别提交 PR,不得提前占用尚未开始的算子。

按要求完成任务并参加成果答辩的学员,可获得本届开源英才夏令营结营证书。

优秀项目评选(只针对线下任务)

答辩结束后,评委将结合小组答辩、PR、代码与测试质量、MetaX C500 验证证据、性能分析及开源复用价值,综合考虑算子难度、实际完成情况、优化效果和工程贡献,评出以下三个奖项:

  • 最佳性能优化(1 组):性能分析准确,优化方案合理,在代表性工作负载上取得稳定且可信的性能提升。
  • 最佳工程实践(1 组):算子交付完整,代码结构清晰,测试覆盖充分,PR 和复现材料规范。
  • 最佳开源贡献(1 组):算子分析和 C500 优化过程完整、可复现,沉淀了可复用的文档、数据或方法,能够支持后续算子开发、硬件适配和社区协作。

原则上每组最多获得一个主奖。评奖不以绝对加速比作为唯一依据,评委将结合算子基础难度、工作量、完成质量和证据可信度综合判断。

项目简介

TileOPs-Metax 是一个基于 TileLang、面向大语言模型训练和推理的 GPU 算子库。项目采用规范驱动的开发模式,帮助开发者和 AI Agent 构建、评估和优化高性能算子。

主要特性

  • 规范驱动:使用机器可读的 Manifest 定义算子签名和工作负载。
  • 性能评估:结合 Benchmark 与 Roofline 分析评估 Kernel 性能。
  • 分层设计:用户接口与硬件优化策略相互独立。

详细文档

关于

TileOPs 是一个基于 TileLang、面向大模型训练与推理的高性能 GPU 算子库。项目采用 Op 与 Kernel 分层架构,并通过算子 Manifest 描述工作负载和 Roofline 公式,支持对算子进行自动验证和硬件性能上限分析。 TileKernels-Metax 相当于是一个不错的算子清单,已包含 MoE Routing、Quantization、Transpose、Eng

16.1 MB
邀请码
    Gitlink(确实开源)
  • 加入我们
  • 官网邮箱:gitlink@ccf.org.cn
  • QQ群
  • QQ群
  • 公众号
  • 公众号

版权所有:中国计算机学会技术支持:开源发展技术委员会
京ICP备13000930号-9 京公网安备 11010802047560号