模型架构
Decoder-only Transformer,LLaMA / Qwen 兼容,权重可互相映射。
- GQA 分组查询注意力 + RoPE 旋转位置编码
- QK-Norm 稳定训练 + Z-loss 正则化 logits
- SwiGLU 门控 FFN + RMSNorm 预归一化
- FlashAttention v2 + 滑动窗口(256K 上下文)
- 深度缩放初始化 — 28 层深网络训练不发散
训练引擎
内置训练加速与稳定性手段,单卡到多卡均可稳定收敛。
- AMP 混合精度(bf16 / fp16 + GradScaler)
- torch.compile 图编译 + Fused AdamW + TF32
- 梯度检查点 — 显存降低约 60%
- EMA 指数移动平均 + 早停 + 断点续训
- 序列 Packing + 动态 Padding + 指令感知 Masking
数据管道
面向大规模语料的流式处理与多领域配比采样。
- 流式数据集 — TB 级预训练数据无需全量加载
- 领域混合 — 代码 / 数学 / 通用 / 推理按权重采样
- 多轮对话 — 自动构建 assistant-only loss mask
评测系统
统一评测引擎:批量生成 → 答案提取 → 评分 → JSON 报告。
- HumanEval — 代码生成 pass@k
- GSM8K — 数学推理 accuracy
- MMLU — 多学科知识 accuracy
- Perplexity — 语言建模 PPL
MSA 长时记忆(原生集成)
Memory Sparse Attention 文档级稀疏路由,让模型具备「离线编码知识库 → 在线按需检索压缩记忆 → 带记忆生成」的能力。
离线编码
encode_documents 将文档库编码为压缩记忆库(MemoryBank),按层存压缩 K/V/KR。
稀疏路由
qr/kr 路由投影 + 余弦 Top-k 文档路由,按需检索相关记忆,不塞满上下文窗口。
零开销退化
memory_layers=None 时等价标准 Decoder,对已有权重与训练脚本完全无破坏。
多模态扩展 · StarMoon-y1
独立拆分于 多模态放这里/StarMoonY1/ 的视觉-语言包,与基座物理隔离。
SigLIP-2 视觉塔
冻结视觉编码器 + Pixel Unshuffle,惰性加载不拖慢纯文本训练。
MLP 投影桥接
2 层 MLP Projector 将视觉特征对齐到语言嵌入空间,轻量高效。
零破坏退化
vision_tower=None 时退化为纯文本 z1,两种形态共享同一套训练代码。