Deterministic context compiler and policy engine for AI coding assistants (Gemini, Claude Code, Cursor, Copilot, Aider, Zed).
Open-source library for training, fine-tuning, and distillation of LLMs on PyTorch (26 author Pull Requests):
- GPU/Host Async Optimization (PR #1026): Implemented
DistillNonfiniteTrackerto catch non-finite teacher logits on GPU tensors without device-to-host synchronization (.item()), preventing throughput stalls during distillation. - Unified Callback Architecture (PR #1023): Unified callback parameter extraction (
soup_callback_kwargs) across all 16 trainers (sft,grpo,dpo,ppo,distill, etc.), adding schema gating and AST validation tests. - RLHF Reward Hacking Stress Tests (PR #918): Added structure-preserving adversarial attack families (
wrapped_junk,answer_spray) to evaluate verifier robustness against reward gaming in reasoning models. - Cross-Platform Security & CI Gates (PR #1024, PR #921): Hardened Windows symlink and TOCTOU defense in draft registries and unified CLI exit code taxonomy (0/2/3) across evaluation gate commands.
