Repository navigation
FlyBrain : routeur qui baisse la RAM de flycoder et flycoder:fast - #6
Merged
Merged
Conversation
FlyBrain is a dependency-free Node server in front of Ollama (port 11435) that answers to flycoder and flycoder:fast. Cheap rules settle clear requests, a Qwen3.5 0.8B micro-router decides the rest, and only one expert is kept in memory. Simple requests go to a smaller expert; hard requests, agent requests with tools and long contexts keep the strong one. - brain/router.mjs, brain/flybrain.mjs, brain/eval-router.mjs - Modelfile.router (Qwen3.5 0.8B) and Modelfile.lite (Qwen3.5 2B) - install.sh builds both and installs the server; publish.sh pushes them - tests for rules, fallback, conversation memory, scheduler and a fake Ollama end to end; labelled routing prompts in tests/fixtures Measured on a 16 GB Linux server (GGUF, CPU): simple flycoder requests use 6.1 GiB instead of 10.5, simple flycoder:fast requests 3.7 instead of 4.6; hard requests are unchanged. Routing: 59/60 labelled prompts. Co-Authored-By: Claude Opus 5.5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01HpBMmLezKyK7FADYUBiPmx
Tromset
marked this pull request as ready for review
October 3, 2026 11:37
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
Résumé
FlyBrain est un petit serveur Node 22 sans dépendance. Il se place devant Ollama sur le port 11435 et répond aux noms
flycoderetflycoder:fast. Chaque demande est aiguillée vers un seul expert, et un seul expert reste en mémoire.flycoder:router(Qwen3.5 0.8B) : il tranche les demandes ambiguës. S'il échoue ou si sa réponse est illisible, la demande part vers le gros modèle.flycoder: 4B pour les demandes simples, 12B pour les difficiles, réflexion forcée.flycoder:fast: nouveauflycoder:0.2-beta-lite(Qwen3.5 2B) pour les demandes simples, 4B pour les autres.Les modèles 0.2 publiés ne changent pas. FlyBrain est facultatif.
Mesures (serveur Linux 16 Go, CPU, poids GGUF)
flycoder, demande simpleflycoder, demande difficileflycoder:fast, demande simpleflycoder:fast, demande difficileRoutage : 59 demandes étiquetées sur 60 sont bien aiguillées (
node brain/eval-router.mjs). Aucune demande difficile n'est partie vers le petit modèle. Les 20 exercices du banc vont tous au gros modèle, donc la qualité mesurée par le banc reste la même. Les règles ont été retouchées une fois après une première mesure sur ces mêmes demandes. Rien n'a encore été mesuré sur Mac avec MLX.Fichiers
brain/router.mjs,brain/flybrain.mjs,brain/eval-router.mjsModelfile.router,Modelfile.liteinstall.shconstruit les deux nouveaux modèles et copie le serveur dans~/.flycoder/brain(--no-brainpour s'en passer).scripts/publish.shpublie les tagsrouteret0.2-beta-lite.tests/router.test.mjscouvre les règles, le repli, la mémoire, l'ordonnanceur et un faux Ollama de bout en bout (API native, OpenAI et Anthropic).ollama launchutilise maintenant le nom publiédelairvictor9/flycoder.Vérification
npm test: 62/62/v1/chat/completionset/v1/messagesen flux, en-têtesx-flybrain-*, un seul expert dansollama ps.🤖 Generated with Claude Code
https://claude.ai/code/session_01HpBMmLezKyK7FADYUBiPmx
Generated by Claude Code