forge-prep
data-readiness tooling for LLM fine-tuning
- audit command emits a 0–100 Forge Readiness Score across six dimensions: volume, quality, dedup, PII, language, format.
DONNÉES, ANALYTIQUE & ML · PARIS, FR
Je transforme les données en décisions et je construis les systèmes qui vont avec, entre analytique, business intelligence et machine learning.
STATUT : MSc Data Science, EDC Paris (diplômé) · Ouvert aux postes en data, analytique et ML
À PROPOS · PARIS, FR
Je construis des systèmes data et ML. Cinq d'entre eux sont assez aboutis pour tenir seuls, et chacun a été construit pour répondre à une question précise, pas pour remplir un portfolio.
forge-prep est un outil d'évaluation de la qualité des données : un package Python publié (v0.1.0) qui audite un corpus d'entreprise et le note de 0 à 100 sur six dimensions avant que ces données n'atteignent le pipeline de fine-tuning Forge de Mistral. Il tourne uniquement sur la bibliothèque standard de Python, avec une suite de 38 tests sous GitHub Actions CI.
KrisCodec est un codec audio neuronal pour la musique, écrit à partir de zéro. Il utilise des activations Snake et un quantificateur vectoriel résiduel, produit un format .kris personnalisé, et décode en environ 7,4 ms. Je l'ai construit pour comprendre la conception d'un codec de bout en bout, pas pour en encapsuler un existant.
ARIA est une architecture de raisonnement. Un GPT-2 Small gelé (124M de paramètres) porte la connaissance, un noyau de raisonnement récurrent (~20M) itère dessus, et un contrôleur d'arrêt (~2M) décide quand s'arrêter. Environ 146M de paramètres au total, dont ~22M entraînables. Je l'ai entraîné sur ARC, GSM8K et PIQA pour tester si la profondeur de raisonnement au moment de l'inférence peut être ajoutée sans réentraîner le socle du modèle.
VOXMAX est un produit grand public déployé : une application Expo / React Native adossée à un backend FastAPI qui transforme environ douze secondes de parole en un score, calculé par un vrai pipeline de caractéristiques acoustiques et non par un simple appel API.
ZXERO v0 a lui aussi été déployé. C'était un pare-feu d'accès au contenu full-stack, construit sur Next.js et FastAPI avec des paiements via Stripe Connect et un moteur de détection de bots par ML, qui a atteint des clients payants et généré 1 247 $ de revenus Stripe réels avant que je ne l'arrête. Le fil conducteur entre ces cinq systèmes : leur comportement est mesurable, et aucun n'est une démo.
Deux autres sont plus récents, et je ne vais décrire ni l'un ni l'autre comme plus abouti qu'il ne l'est. Stickbook est un scrapbook partagé pour les voyages en groupe : pas d'application, pas de compte, on rejoint par un lien ou un QR code, on colle une photo sur la page avec une légende en police manuscrite, et elle apparaît en direct pour tout le groupe. ZXERO, la version actuelle, construite sur ce que ZXERO v0 m'a appris, est une couche d'exploitation IA : une mémoire qui persiste entre les outils, une perception de ce qui est affiché et actif à l'écran, et la capacité d'exécuter plutôt que de simplement répondre. C'est en développement actif ; je ne le décris pas encore comme plus abouti que ça.
J'ai commencé par la couche physique. Mon BTech est en génie électrique, électronique et communications, du Mahatma Gandhi Institute of Technology (décembre 2020–juillet 2024) : traitement du signal et pensée systémique appris depuis le matériel, avant que tout cela ne soit abstrait derrière un framework.
Au milieu de ce parcours, j'ai passé quatre mois chez Zonta Technologies à Hyderabad (octobre 2022–janvier 2023). J'ai développé et exécuté des stratégies et plans de test pour l'évaluation de plateformes, et soutenu l'intégration produit, la certification, les essais et les tests d'interopérabilité pour NDL (Network Design Lab) et FIT (First in Test). C'était de l'ingénierie de test et d'intégration, et cela m'a appris ce qu'il faut pour tenir un engagement de conformité à une norme avant la mise en production.
Je suis venu à Paris pour un MSc en Data Science & Business Intelligence à l'EDC Paris Business School (septembre 2024–septembre 2026). J'ai choisi volontairement un programme à la croisée de l'ingénierie et du business : c'est à cette intersection que le travail sur la donnée trouve réellement sa place, et faire comme si ce n'était pas le cas produit de moins bons systèmes.
La leçon que je retiens vient de l'arrêt de ZXERO v0. Ça fonctionnait. C'était déployé, ça détectait les bots, et ça générait de l'argent réel. Je l'ai arrêté quand même, parce que lorsque Cloudflare est entré sur le marché du pay-per-crawl, l'équation économique ne justifiait plus de faire grandir un pare-feu construit en solo face à un acteur CDN établi. Arrêter quelque chose qui fonctionne coûte plus cher qu'abandonner quelque chose qui ne fonctionne pas : il faut neutraliser la partie de soi qui lit « ça tourne » comme « ça doit continuer ». Prendre cette décision sur la base d'une lecture du marché relève du même jugement que celui qui a justifié de le construire.
La deuxième chose vers laquelle je reviens sans cesse, c'est la distance entre un système qui tourne et un système dont on peut mesurer le comportement. Faire tourner quelque chose, c'est la partie facile. Le chiffre de décodage de KrisCodec, environ 7,4 ms, existe parce que je l'ai mesuré, et l'outillage d'évaluation de forge-prep existe parce qu'un corpus qu'on ne peut pas noter est un corpus auquel on ne peut pas faire confiance. J'optimise pour le second type de système : celui qui vous dit quand il a tort.
Au quotidien, je travaille en Python et SQL, je construis des pipelines et de l'ETL, du packaging et de la CI, ainsi que les contrôles de schéma et de qualité de données qui les rendent fiables. J'utilise Power BI, Tableau et pgAdmin quand il s'agit d'analyse, de dashboarding et de reporting. Côté ML, cela veut dire PyTorch, le traitement du signal audio, l'outillage d'évaluation, la préparation de données pour le fine-tuning, et la quantification vectorielle. Quand quelque chose doit être mis en production, c'est généralement FastAPI et des backends REST, React Native / Expo, Web Audio, et le déploiement qui va avec.
Je laisse de côté ce que j'ai touché une fois mais jamais livré. C'est tout l'intérêt de cette page.
Ouvert aux postes en data, analytique et ML : des équipes qui construisent de l'outillage d'évaluation, de l'infrastructure data, ou des systèmes ML où le travail est mesuré, pas affirmé.
data-readiness tooling for LLM fine-tuning
neural audio codec
recurrent reasoning architecture
shipped voice-scoring product
content-access firewall, shipped and sunset

shared scrapbook for group trips

AI operating layer, memory + perception + action

Tableau dashboard for project performance monitoring

Power BI HR attrition analysis