从一次成功到百次稳定:面向机器人操作任务的证据驱动 ACT 可靠性流水线。
StackPilot-ACT 把环境预检、训练阶段控制、候选冻结和证据校验串成可复查的脚本流程。目标不是用一次演示替代可靠性,而是让每个阶段都有明确输入、失败边界和可核验输出。
本仓库只含原创控制/证据脚本及其文档和测试,不包含、复制或再分发以下内容:
- 官方 Starter 源码;
- Tron2 机器人模型与机器人资产;
- 训练或评测数据;
- checkpoint、统计文件和其他模型权重。
本仓库不再分发官方 Starter,也不包含或分发任何训练/评测数据和模型权重。
运行完整流程前,请从 troncamp-mani 官方仓库 获取官方 Starter,并从赛事授权渠道取得赛事资产。训练数据必须由使用者自行采集,模型权重必须由使用者自行训练;本仓库和官方 Starter 都不应被理解为提供本项目的数据或权重。本仓库的 MIT 许可仅覆盖本仓库原创文件,不能替代或扩张任何上游许可。依赖与第三方材料的详细边界见 NOTICE.md。
以下数据只描述 T1 本地流水线与外部状态的历史快照,不代表官方排行榜成绩:
| 阶段 | 当前证据 | 边界 |
|---|---|---|
| 原始数据 | T1 原始 HDF5 共 200 条 | 仅为当前任务的采集结果 |
| 处理后数据 | T1 处理后 HDF5 共 200 条 | 仅为当前任务的处理结果 |
| 训练 | ACT 已训练 3000 epoch | 不代表评测成功率 |
| 验证 | best val loss 为 0.032336,出现在 epoch 2951 | 验证损失不是官方得分 |
| 冒烟评测 | 20 个公共种子 smoke 为 13/20,即 0.65 | 20-seed 不是官方 100-seed,二者不可等同 |
| 正式评测 | 截至 2026-07-20T23:55:00+08:00,现场观测状态为 queued;这是历史快照,当前队列状态与官方结果均为 unknown(未知) |
不得用历史队列观测宣称当前提交状态、提交成功或获得分数 |
T1 只达标,不计主榜分。因此,本仓库不会把 T1 的本地 smoke 结果包装成主榜成绩,也不会把 20-seed 结果外推为官方 100-seed 结果。
scripts/bootstrap_flux.sh:准备受约束的运行环境并执行环境自检;scripts/flux_preflight.sh:检查运行前依赖与关键路径;scripts/train_act_stage.sh:执行 ACT 分阶段训练与形状校验;scripts/make_candidate.sh:冻结候选 checkpoint、配套统计文件和校验和;scripts/download_torch_wheel.sh:以可续传方式获取指定依赖轮子。
这些脚本是流水线控制层,不会替代官方 Starter。调用路径、任务配置和数据格式仍以所获取的上游版本为准。
- 系统设计:公开流水线、阶段边界和证据状态机;
- 复现指南:固定官方 Starter 版本后的 T1 采集、处理、训练和本地评测命令;
- 结果与证据等级:区分现场观测、待完成事项和公众可复核边界;
- 三分钟视频脚本:178 秒中文分镜、素材清单和导出规范;
- T1 证据索引:公开事实与未公开原始证据说明;
- 机器可读 manifest:观测项与待完成项的结构化状态。
在仓库根目录运行:
for test_script in tests/*.sh; do
bash "${test_script}"
done发布基础测试会检查文档边界、实测数据声明、忽略规则、已跟踪大文件与 shell 语法。
禁止提交令牌、凭据、云桌面链接、数据、视频或模型文件。发现潜在泄密时,请按 SECURITY.md 处理。
本仓库原创文件采用 MIT License。第三方组件、官方 Starter、机器人模型与资产不在该许可覆盖范围内,详见 NOTICE.md。