Features

核心特性

完整链路 · 生产级工程 · 长时记忆——用约 2500 行可读核心代码,覆盖从原始语料到可上线模型的全流程。

模型架构

Decoder-only Transformer,LLaMA / Qwen 兼容,权重可互相映射。

  • GQA 分组查询注意力 + RoPE 旋转位置编码
  • QK-Norm 稳定训练 + Z-loss 正则化 logits
  • SwiGLU 门控 FFN + RMSNorm 预归一化
  • FlashAttention v2 + 滑动窗口(256K 上下文)
  • 深度缩放初始化 — 28 层深网络训练不发散

训练引擎

内置训练加速与稳定性手段,单卡到多卡均可稳定收敛。

  • AMP 混合精度(bf16 / fp16 + GradScaler)
  • torch.compile 图编译 + Fused AdamW + TF32
  • 梯度检查点 — 显存降低约 60%
  • EMA 指数移动平均 + 早停 + 断点续训
  • 序列 Packing + 动态 Padding + 指令感知 Masking

数据管道

面向大规模语料的流式处理与多领域配比采样。

  • 流式数据集 — TB 级预训练数据无需全量加载
  • 领域混合 — 代码 / 数学 / 通用 / 推理按权重采样
  • 多轮对话 — 自动构建 assistant-only loss mask

评测系统

统一评测引擎:批量生成 → 答案提取 → 评分 → JSON 报告。

  • HumanEval — 代码生成 pass@k
  • GSM8K — 数学推理 accuracy
  • MMLU — 多学科知识 accuracy
  • Perplexity — 语言建模 PPL

MSA 长时记忆(原生集成)

Memory Sparse Attention 文档级稀疏路由,让模型具备「离线编码知识库 → 在线按需检索压缩记忆 → 带记忆生成」的能力。

离线编码

encode_documents 将文档库编码为压缩记忆库(MemoryBank),按层存压缩 K/V/KR。

稀疏路由

qr/kr 路由投影 + 余弦 Top-k 文档路由,按需检索相关记忆,不塞满上下文窗口。

零开销退化

memory_layers=None 时等价标准 Decoder,对已有权重与训练脚本完全无破坏。

多模态扩展 · StarMoon-y1

独立拆分于 多模态放这里/StarMoonY1/ 的视觉-语言包,与基座物理隔离。

SigLIP-2 视觉塔

冻结视觉编码器 + Pixel Unshuffle,惰性加载不拖慢纯文本训练。

MLP 投影桥接

2 层 MLP Projector 将视觉特征对齐到语言嵌入空间,轻量高效。

零破坏退化

vision_tower=None 时退化为纯文本 z1,两种形态共享同一套训练代码。