Équipe Topologie Algébrique
|
Je travaille conjointement à l'université Sorbonne Paris Nord et dans l'industrie, pour une approche de l'intelligence artificielle tirant parti de géométrie des espaces homogènes. Il s'agit de proposer une approche pratique et efficace pour optimiser les LLM ou les World Models par un encodage plus géométrique, par exemple en travaillant sur les espaces totaux des fibrés tautologiques sur les Grassmanniennes. Deux applications ont été menées à leur terme, l'une sur les World Models, l'autre sur la compression de la KV cache. Bundle-Transformer La proposition initiale. Whitepaper et défis d'un encodage Grassmannien : attention hybride mêlant similarité d'instance et distance chordale entre sous-espaces, transport parallèle dans les fibres. Note de positionnement : [PDF]. World Models : l'encodage grassmannien comme mécanisme anti-collapse Implémentation d'un encodage géométrique pour un World Model offrant un mécanisme anti-collapse, sans aucun régularisateur. Résultat obtenus sur un premier benchmark (TwoRoom-v1): un prédicteur à valeurs dans le fibré tautologique de Gr(8,16) atteint 98,3 % de réussite avec 26 760 paramètres, contre 84 % pour LeWM, dont le prédicteur demande 7 millions de paramètres (travail post-hoc, à partir de l'encodeur de LeWM gelé). Méthode, protocole et résultats : [PDF]. NovaKV : compression du KV cache Le cache des clés et valeurs d'un LLM croît linéairement avec le contexte et domine le coût mémoire de l'inférence. Dans un contexte de pénurie de la RAM, il sagit ici d'optimiser la mémoire utilisée par un modèle pour des raisons écologiques, économiques ou d'usage. NovaKV le réduit de 45 %, à partir d'un modèle gelé (prêt à l'usage sur Llama3.1-8b-instruct et Mistral-7b-instruct) en traitant de manière asymétrique les projections de clé et de valeur. Méthode et résultats : [PDF]. Code d'inférence, poids compressés et commandes pour reproduction : [GitHub]. |