T

OwnerSunshine530 cb2913cda8 perf: searchsorted 构造因果mask，消除最后一个同步点(repeat_interleave张量repeats)

dense MoE 去掉MoE的nonzero同步省了评测20s；embedding融合(无同步)只省1s
->真正的杠杆是消同步点。mask构造的repeat_interleave(lengths张量)是model(batch)
内最后一个同步点，改用searchsorted求doc_id(输出size已知,无同步)。等价测试已加。

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>

2026-06-15 12:09:40 +08:00

docs/superpowers

docs: 添加冲击80+实现计划（阶段A找回AUC + 阶段B延迟重写）

2026-06-14 16:46:05 +08:00

代码

perf: searchsorted 构造因果mask，消除最后一个同步点(repeat_interleave张量repeats)

2026-06-15 12:09:40 +08:00

论文

docs: 修复论文 OCR markdown 图片路径，添加 33 张提取图片

2026-06-13 21:23:55 +08:00

.gitignore

chore: .gitignore 添加 .env（密钥防护）

2026-06-13 12:33:06 +08:00

CLAUDE.md

docs: 更新提交记录和优化路线（Expert 合并 58.86 最优）

2026-06-14 12:24:48 +08:00

LICENSE

Initial commit

2026-06-03 13:14:36 +08:00

README.md

docs: README 添加比赛规则、主页、提交链接

2026-06-12 20:58:10 +08:00

推理优化方案.md

docs: 添加详细推理优化方案（含合规审查）

2026-06-03 14:18:17 +08:00

README.md

CTI-Inference-Opt

百度商业AI技术创新大赛 (CTI) 2026 — 生成式推荐广告排序推理性能优化

赛题

比赛主页 · 大赛官网 · 提交结果

给定基于 Transformer 的生成式推荐广告排序模型（GRAB），在不改变模型结构、不在测试集上训练的前提下，极致优化推理性能。

量化、稀疏、剪枝明确允许。

模型架构

RepEncoder (28 slots × 512d Embedding)
  → 8 层 Transformer (512d, 8 heads, Pre-LN)
    → Multi-Head Attention
    → SMoE FFN (8 experts, Top-2 gating)
  → Linear → Sigmoid → CTR

~~6.5M~~11.3M 参数，基于 GRAB / HSTU 论文。

评分规则

详见比赛规则

维度	要求	不达标
推理效率	≤ 5min，环境构建 ≤ 20min	总分 0
模型效果	AUC ≥ 0.65，PCOC ∈ [0.85, 1.15]	总分 0

优化路线

步骤	方案	预期加速
✅ 第一版	接口对齐 + FP16 量化	229s → ~120s
🔲 第二版	Flash Attention + torch.compile	~120s → ~65s
🔲 第三版	MoE 剪枝 + INT8 量化	~65s → ~30s

提交

cd 代码/code
zip submit.zip infer.py requirements.txt build_env.sh

约束：不包含 dataset/、ckpt.pt，每天最多 10 次提交。

环境

本地: .venv (Python 3.13, uv), 仅装 numpy + tqdm + aistudio-sdk
服务端: PyTorch 2.6.0 + CUDA 12.4，完整依赖见 代码/code/requirements.txt

许可证

MIT License

README.md Unescape Escape

CTI-Inference-Opt

赛题

模型架构

评分规则

优化路线

提交

环境

许可证

README.md