Nicolas Scheer
accueil / projets / rl-mesh
2026Reinforcement Learningen cours

rl_mesh

Un agent RL apprend la locomotion physique d'un personnage par imitation de mocap, sans key-framing manuel.

6 boucles d'entraînement — politique PPO en cours d'apprentissage

Problème

Produire une locomotion de personnage physiquement plausible et stylisée (marche, vitesse et cap contrôlables) sans animation manuelle image par image.

Approche

Humanoïde MuJoCo actionné par PD (PPO), entraîné par imitation directe d'un clip de mocap : résidu autour de la pose de référence, reward de suivi de pose. Étape suivante en cours : Adversarial Motion Priors (discriminateur LSGAN + reward de tâche sur vitesse/cap), migré vers JAX/MJX pour vectoriser l'entraînement de milliers d'humanoïdes en parallèle sur GPU.

Résultats

Sur son meilleur run d'entraînement, l'agent tient la marche sans tomber sur l'intégralité de l'épisode (300/300 steps). Un script d'évaluation dédié (eval_checkpoints.py) compare tous les checkpoints d'un run pour repérer le meilleur avant un éventuel effondrement de PPO en entraînement long. Voir la démo ci-dessous.

Autres projets

tous les projets →