IA privée et sur site

Exploitez l’IA tout en gardant la maîtrise de vos données sensibles.

Adopter l’IA ne signifie pas nécessairement transmettre l’information de l’entreprise à un service public externe. Les modèles modernes peuvent s’exécuter dans un nuage privé, sur une infrastructure dédiée, dans les installations de l’organisation ou, pour certains besoins spécialisés, dans un environnement isolé.

Underlabs adapte l’architecture au degré de confidentialité, de maîtrise et d’indépendance opérationnelle que chaque charge de travail exige réellement.

Le principe central

L’IA privée couvre plusieurs modes de déploiement.

Le meilleur choix n’est pas nécessairement celui qui offre la plus grande maîtrise. Il doit correspondre aux données, aux capacités, au budget et aux responsabilités que l’organisation peut réellement assumer.

Charge opérationnelle plus faibleMaîtrise accrue de l’infrastructure
  1. 01
    API géréeLe fournisseur exploite le modèle et l’infrastructure.
  2. 02
    IA dédiée ou à locataire uniqueUn environnement isolé est réservé à un client.
  3. 03
    Nuage privé ou VPCL’inférence s’exécute dans l’environnement infonuagique privé de l’organisation.
  4. 04
    Nuage canadien maîtrisé par le clientLe client garde la maîtrise du déploiement dans une infrastructure canadienne.
  5. 05
    IA sur siteLe modèle fonctionne sur du matériel dont l’organisation garde la maîtrise.
  6. 06
    IA isolée du réseauUn environnement spécialisé fonctionne sans dépendance réseau externe à l’exécution.
Une maîtrise accrue peut améliorer

la confidentialité, l’isolation, la personnalisation, la visibilité sur la gouvernance et l’indépendance du déploiement.

Elle peut aussi augmenter

les coûts, les besoins matériels, la maintenance, la planification de capacité et la responsabilité opérationnelle.

Quand une API publique ne convient pas

Les API gérées sont souvent un excellent choix.

Elles offrent souvent le moyen le plus rapide et le plus économique de déployer l’IA, avec un accès rapide aux nouveaux modèles, une capacité élastique et une infrastructure déjà exploitée. Elles ne sont pas moins sûres par définition.

Certaines organisations ont toutefois des raisons contractuelles, réglementaires, de gouvernance ou de politique interne d’exiger une maîtrise plus étroite pour certaines charges de travail.

  • Documents d’entreprise confidentiels
  • Recherche propriétaire
  • Information financière interne
  • Documents juridiques
  • Données sensibles sur la clientèle
  • Charges réglementées
  • Information industrielle
  • Systèmes liés à la santé
  • Opérations internes critiques
  • Information gouvernementale
  • Propriété intellectuelle de valeur

L’emplacement de l’inférence

Le modèle doit s’exécuter quelque part.

Lorsqu’une personne pose une question à un modèle d’IA, celui-ci effectue des calculs sur du matériel physique. Ce traitement s’appelle l’inférence.

La question d’architecture est simple : où ce traitement a-t-il lieu?

Un parcours d’inférence
  1. 01Votre application
  2. 02Requête ou documents
  3. 03Inférence du modèle
  4. 04Réponse

L’inférence peut s’exécuter chez un fournisseur d’IA, dans un environnement dédié, dans un VPC privé, sur une infrastructure canadienne, dans un centre de données client, sur un serveur local ou sur du matériel en périphérie.

Modèles de déploiement

Un périmètre adapté à chaque besoin.

Ces modèles servent de points de repère; ce ne sont pas des niveaux de sécurité ou de conformité. Leur pertinence dépend du système complet.

01

IA gérée

  1. 01Application
  2. 02Fournisseur d’IA externe
  3. 03Réponse

Pertinent pour : Rapidité, expérimentation, élasticité et faible charge opérationnelle.

02

IA dans un nuage privé

  1. 01Application
  2. 02Réseau privé
  3. 03Modèle et données privés

Pertinent pour : Maîtrise accrue sans devoir posséder le matériel.

03

IA sur site

  1. 01Application interne
  2. 02Réseau interne
  3. 03Modèle et données locaux

Pertinent pour : Maîtrise directe des opérations, faible latence ou fonctionnement local.

04

IA isolée

  1. 01Application isolée
  2. 02Modèle isolé
  3. 03Données isolées

Pertinent pour : Environnements hautement sensibles où l’isolement est réellement requis.

Deux distinctions importantes

Privé, sur site et à poids ouverts ne désignent pas la même chose.

01

Privé ne veut pas nécessairement dire local

Une IA privée peut fonctionner dans un nuage privé, un environnement dédié ou une infrastructure canadienne maîtrisée par le client. Sur site décrit l’emplacement et la maîtrise du matériel physique. Privé renvoie surtout à la maîtrise et à l’isolation. Les notions se recoupent sans être identiques.

02

Hébergé soi-même ne veut pas nécessairement dire libre

Un déploiement privé peut employer des modèles à poids ouverts, des modèles sous licence commerciale ou des modèles propriétaires offerts dans le cadre d’une entente d’entreprise. Les droits de licence et de déploiement varient. À l’inverse, des poids ouverts ne rendent pas automatiquement tout le système privé.

Le véritable périmètre

La confidentialité doit couvrir toute la chaîne d’IA, pas seulement le LLM.

Une entreprise peut héberger son propre modèle tout en envoyant des renseignements sensibles à un analyseur de documents, à un service d’embeddings, à une base vectorielle ou à un outil de journalisation externe.

Le caractère privé de l’IA dépend de l’architecture, et non seulement du modèle de langage.

Chaque composant peut traiter les données
  1. 01Utilisateur
  2. 02Application
  3. 03Analyse de documents
  4. 04Modèle d’embeddings
  5. 05Base de données vectorielle
  6. 06LLM
  7. 07Journaux et surveillance

Données internes et RAG

Appuyer les réponses sur les connaissances de l’organisation.

Les organisations veulent souvent que l’IA réponde à partir de leurs documents, politiques, bases de données et connaissances internes, plutôt que de se limiter aux connaissances déjà intégrées au modèle.

Cette architecture, couramment appelée génération augmentée par la récupération ou RAG, étend les exigences de confidentialité au stockage, à l’indexation, aux embeddings, à la recherche, à l’inférence et aux journaux.

Un parcours RAG simplifié
  1. 01Documents et données internes
  2. 02Recherche et récupération
  3. 03Information pertinente
  4. 04Modèle d’IA
  5. 05Réponse fondée

Adapter le système au travail

Une IA privée n’exige pas toujours le plus gros modèle.

Certaines charges de travail se règlent avec de plus petits modèles de langage, des modèles spécialisés, des embeddings, des reclasseurs, des classificateurs, des modèles de vision ou une automatisation déterministe combinée à l’IA.

Petit modèle privé+récupération+règles d’affaires+API existantes

Le but est de résoudre le problème d’affaires avec une capacité suffisante, pas de maximiser le nombre de paramètres.

Architecture hybride

Tout n’a pas à être public ou privé.

Une architecture peut acheminer chaque tâche selon sa sensibilité, ses besoins de capacité, son coût, sa latence, sa résidence et sa disponibilité.

Séparer les données de la tâche

  1. 01Données internes sensibles
  2. 02Environnement d’IA privé
  3. 03Tâche assainie et non sensible
  4. 04IA externe avancée

Limiter le contexte transmis

  1. 01Connaissances internes
  2. 02Récupération privée
  3. 03Contexte approuvé seulement
  4. 04Modèle externe

Acheminer selon la capacité

Tâches courantesModèle privéTâches complexes non sensiblesModèle externe avancé

Routage et portabilité

Éviter une dépendance inutile à un seul modèle.

Une couche de service conçue à cette fin peut acheminer les demandes vers un modèle privé, externe ou spécialisé, puis faciliter les changements futurs.

Cela ne garantit pas une indépendance totale. Les modèles diffèrent par leurs API, leur utilisation d’outils, leurs fenêtres de contexte, leurs capacités et leurs formats de sortie. La portabilité exige des interfaces, des évaluations et des essais.

Une couche de service entre l’application et les modèles
ApplicationCouche de service IA
LLM privéLLM externeModèle spécialisé

Réalité opérationnelle

Une plus grande maîtrise entraîne aussi plus de responsabilités.

L’IA sur site exige des décisions sur la mémoire GPU, la capacité de calcul, l’alimentation, le refroidissement, la redondance, le stockage, le réseau, la surveillance et les mises à jour de modèles.

La rentabilité dépend du volume de requêtes, de la prévisibilité de l’utilisation, des mouvements de données, de la latence, de la connectivité et de la valeur accordée à l’indépendance à long terme. À une échelle suffisante, une infrastructure dédiée peut présenter un profil économique différent de la tarification par jeton.

L’IA privée n’est pas toujours moins chère. Elle est souvent plus coûteuse. Le choix doit tenir compte de l’ensemble des exigences, et non seulement du prix unitaire de l’inférence.

Un exemple canadien, pas une prescription

Des fournisseurs destinés aux entreprises offrent le déploiement privé.

L’entreprise canadienne Cohere, par exemple, documente des options gérées, dédiées, en nuage privé ou VPC et sur site, y compris des environnements isolés qui peuvent fonctionner sans accès réseau à l’exécution. La disponibilité et les modalités varient selon l’offre et l’entente. Consulter la documentation officielle de Cohere.

Cohere est un exemple parmi plusieurs. Le modèle et le fournisseur doivent être choisis après avoir défini la charge de travail, les données et le périmètre de maîtrise.

L’approche Underlabs

Commencer par le besoin, pas par le matériel.

Vous n’avez pas à choisir un modèle, un orchestrateur ou des GPU avant de nous parler. Une exigence comme « utiliser l’IA sur de l’information interne sensible sans tout envoyer à un service public » est un point de départ suffisant.

  1. 01

    Définir la charge de travail

    Que doit réellement accomplir l’IA?

  2. 02

    Classifier les données

    Quelle information entre dans le système et laquelle est réellement sensible?

  3. 03

    Définir le périmètre de maîtrise

    Qu’est-ce qui peut quitter l’environnement et qu’est-ce qui doit y rester?

  4. 04

    Évaluer les modèles

    Comparer les options privées et gérées avec la charge de travail réelle, pas seulement leur marque.

  5. 05

    Choisir l’architecture

    API gérée, environnement dédié, nuage privé, infrastructure canadienne, sur site ou hybride.

  6. 06

    Construire l’application complète

    Interfaces, API, recherche, intégrations, automatisation, permissions, flux de travail et surveillance.

  7. 07

    Mesurer et faire évoluer

    Concevoir le système pour qu’il puisse évoluer avec les modèles et les besoins.

Les prochaines décisions

Quel modèle, puis quelle infrastructure?

Une fois la limite de déploiement définie, le choix du modèle dépend de sa capacité, de la langue, du raisonnement, de la latence, du matériel, du coût, de la licence et des droits de déploiement. Les modèles canadiens, les modèles internationaux à poids ouverts et les déploiements commerciaux privés sont tous des options possibles.

L’exécution privée exige aussi un lieu : capacité GPU, nuage canadien, centre de données, stockage, réseau et orchestration. Ces choix d’infrastructure constituent une décision distincte.

De l’exigence au déploiement

Définissons le bon périmètre pour votre charge de travail.

Présentez-nous le processus, les données sensibles, les systèmes existants et vos contraintes. Underlabs peut vous accompagner de l’architecture et du choix du modèle jusqu’au prototype, aux essais, au déploiement et à l’intégration.