Documentation produit
Bien lire les données avant de vouloir bien calculer
Un plugin d’agent de programmation optimisé pour le calcul mathématique et l’analyse statistique.
Pize est un assistant de codage IA destiné au calcul scientifique et à l’analyse statistique. Il fonctionne dans Pize Code et Positron et est également fourni sous forme de SDK. Il concentre ses efforts sur l’étape la plus sujette aux erreurs et la plus souvent négligée : la reconnaissance et la lecture des données statistiques. Ce n’est qu’une fois les données correctement comprises que les calculs, les tests et l’inférence peuvent être justes.
Reconnaître d’abord
Les séparateurs, les en-têtes, les valeurs manquantes et les types de colonnes sont déterminés un à un. Une mauvaise décision compromet silencieusement toute la chaîne d’analyse.
Calculer sur des données réelles
Il lit la session R / Python déjà en cours. Le modèle voit de vrais data frames et des statistiques de synthèse.
Des résultats qu’on peut recalculer
Écrire le code, l’exécuter, lire la sortie et les graphiques, puis corriger — toute la boucle reste dans l’éditeur.
Ce qu’est Pize
Dire ce que fait Pize, puis ce qu’il ne fait pas
Pize est un assistant de programmation IA pour le calcul scientifique et l’analyse statistique. Il fonctionne dans Pize Code et Positron, et est également proposé sous forme de SDK.
La plupart des agents de programmation consacrent leurs efforts à produire davantage de code. En statistique et en recherche, les erreurs surviennent généralement plus tôt : si les données sont mal lues, chaque test, modèle et inférence qui suit hérite discrètement de cette erreur. Pize intervient à ce niveau : il veille d’abord à ce que le modèle connaisse la forme, les types et les valeurs manquantes des données, puis il écrit et exécute du code, interprète les graphiques et apporte des corrections dans la session R / Python que vous utilisez déjà.
Pize est aussi un agent de programmation complet : modifications dans plusieurs fichiers, terminal, planification et exécution, règles de projet, choix de modèles et accès, via MCP, aux outils déjà présents dans un laboratoire ou un système interne. Utilisez-le dans Pize Code, Positron, avec la CLI ou via le SDK.
- Ce qu’est Pize. Un agent de programmation optimisé pour le calcul mathématique et l’analyse statistique. La lecture, le calcul et les tests ont lieu dans une session active. Les résultats peuvent être recalculés.
- Ce que Pize n’est pas. Ce n’est ni un outil générique de complétion de code simplement remaquillé, ni un substitut à Cursor qui écrirait un peu de tout. L’objectif n’est pas la complétion, mais la lecture correcte des données et la fiabilité des calculs.
- Où il fonctionne. Dans Pize Code, Positron, avec la CLI et via le SDK.
- Ce qui est transmis au modèle. La structure, les types, les valeurs manquantes et des résumés, plutôt que la table entière insérée dans le contexte. Les observations brutes restent dans la session.
Trois portes d’entrée, un seul agent
Dans l’éditeur, Pize est un plugin de barre latérale. Dans vos propres outils, il prend la forme d’un SDK. Il passe par MCP pour atteindre une base de données, un logiciel d’instrumentation ou une base de connaissances interne. Les trois voies utilisent la même logique de lecture, les mêmes calculs et la même limite d’approbation.
Vue d’ensemble
Où s’exécute Pize, comment l’utilisation des modèles est facturée et qui approuve les actions
Le même agent de programmation lit des fichiers, écrit du code, lance des commandes et peut piloter un navigateur. Chaque modification et chaque commande nécessitent votre approbation. Utilisez-le dans Pize Code, Positron, la CLI ou via le SDK.
Points d’accès disponibles
- Pize Code. Un plugin dans la barre latérale de l’éditeur. Modifications multi-fichiers, terminal, modes de planification et d’exécution, et diffs pouvant être relus.
- Positron. Le même agent, avec en plus un pont vers la session R ou Python déjà au premier plan.
- SDK. Le même agent intégré dans un programme que vous utilisez déjà, également disponible via la CLI.
Facturation de l’utilisation des modèles
L’utilisation en libre-service est réglée avec des crédits prépayés. Un crédit vaut un centime de dollar américain. Achetez un pack sur la page des tarifs ; Stripe encaisse le paiement. Les conditions entreprise sont convenues après prise de contact.
Entreprise
Aucun tarif n’est publié pour les laboratoires ni pour les conditions personnalisées. Ces conditions sont convenues après prise de contact.
C’est aussi un agent de programmation complet
La lecture des données et la passerelle de session constituent le niveau supplémentaire apporté par Pize. La suite présente les capacités de l’agent de programmation complet qu’il est également : sans elles, la boucle statistique ne peut pas fonctionner.
01
Modifications multi-fichiers et revue des diffs
Les modifications sont coordonnées entre plusieurs fichiers. Chacune produit un diff vérifiable et réversible, et une tâche entière peut être annulée.
02
Exécution dans le terminal et sortie en direct
Exécuter des commandes dans le terminal intégré et suivre leur sortie en direct. Les erreurs et les échecs de tests sont détectés immédiatement.
03
Modes planification / action
Inspecter d’abord les données et le code, puis convenir d’un plan d’analyse avant d’agir, afin de ne pas exécuter d’emblée un modèle statistique inadapté.
04
Références de contexte et débogage navigateur
Donner le contexte précisément avec @file, @folder, @problems, @url. Il peut aussi piloter le navigateur, prendre des captures et lire les journaux.
05
Règles de projet et compétences
Écrire définitions statistiques, conventions de graphiques et règles de dossiers dans un fichier de règles, pour que chaque session de l’équipe les suive.
06
Choix du modèle et MCP
Anthropic, OpenAI, Gemini, DeepSeek, Bedrock, OpenRouter et les modèles locaux peuvent tous être connectés. Les bases de données sont accessibles via MCP.
Kit de développement logiciel
Un SDK est un kit qu’un autre programme peut appeler, pas un autre site web
Un SDK (Software Development Kit, ou kit de développement logiciel) regroupe des API, des types et des exemples afin qu’un autre programme puisse appeler une fonctionnalité sans avoir à la réimplémenter.
Sans SDK, chaque intégration écrit ses propres appels HTTP et devine la signification des champs. Avec un SDK, le programme appelant dispose de noms de fonctions stables, de types et d’un exemple réellement exécutable. C’est à ce niveau qu’un modèle s’intègre dans un logiciel d’acquisition de laboratoire ou une plateforme d’analyse interne.
- Ce qu’il fournit. Des interfaces appelables, des types et le plus petit exemple fonctionnel. Le programme appelant n’a pas à réinventer la lecture des données ni la session.
- Ce qu’il ne fournit pas. Il ne remplace pas l’interface de votre produit et ne choisit pas la méthode statistique. La méthode reste proposée par le modèle et soumise à votre confirmation.
- Sa différence avec le plugin. Le plugin s’ouvre dans l’éditeur. Le SDK intègre le même agent dans un programme que vous utilisez déjà, sans ajouter de barre latérale.
Ce que fait le SDK Pize
Pize regroupe la lecture des données, la passerelle de session et l’agent de programmation dans un package intégrable. Un outil de laboratoire ou un programme interne n’a pas besoin d’une autre fenêtre d’éditeur pour permettre au modèle de calculer sur des données réelles et d’apporter des modifications après votre confirmation.
Model Context Protocol
MCP est un connecteur, pas un autre modèle
MCP (Model Context Protocol) est un protocole ouvert : il permet à un modèle d’accéder, pendant l’exécution, à des outils, des données et des prompts externes, sans créer une connexion propriétaire pour chaque source.
Un modèle se limite au raisonnement. Il ne peut ni voir votre base de données ni manipuler les paramètres d’un logiciel d’instrumentation. MCP définit trois éléments : les outils (actions appelables), les ressources (données lisibles) et les prompts (instructions réutilisables). Tout système qui met en œuvre ce contrat peut être utilisé de la même manière par le modèle.
- Le problème qu’il résout. Le modèle et le système externe n’ont plus à inventer chacun une connexion propriétaire. Les bases de données, les bases de connaissances et les passerelles internes sont accessibles au moyen d’un protocole commun.
- Ce qu’il n’est pas. Ce n’est ni un modèle ni un SDK. MCP ne détermine pas comment intégrer l’agent dans votre propre programme ; il définit uniquement comment l’agent en cours d’exécution se connecte à l’extérieur.
- Dans Pize. Pize se connecte en tant que client à d’autres serveurs MCP. La limite de sécurité reste votre approbation : lecture seule par défaut et attente de votre confirmation avant toute action.
Ne pas confondre MCP et SDK
Le SDK répond à la question « comment intégrer Pize dans mon programme ? ». MCP répond à la question « comment l’agent en cours d’exécution accède-t-il aux outils et aux données dont je dispose déjà ? ». Le premier sert à intégrer, le second à connecter des ressources externes.
Comment les trois niveaux se rejoignent
Le modèle raisonne, le SDK intègre, MCP donne accès
Pour qu’un système d’IA obtienne des résultats justes en recherche, il lui manque rarement « un modèle plus grand ». La question est de savoir si le modèle peut voir des données réelles, utiliser de vrais outils et fonctionner dans les logiciels que vous employez déjà.
Pize distingue ces trois niveaux tout en les reliant. Le modèle choisit une méthode et écrit le code. Le SDK place cet agent dans vos outils. MCP lui permet d’accéder, pendant l’exécution, aux bibliothèques, aux logiciels d’instrumentation et aux systèmes internes. La lecture reste la première étape : si les données sont erronées, les deux autres niveaux ne font que propager l’erreur.
| Niveau | Rôle | Dans Pize |
|---|---|---|
| Modèle | Raisonner, choisir une méthode, écrire du code | Tout modèle d’un fournisseur connecté, ou un modèle local |
| SDK | Intégrer l’agent dans un programme existant | La même lecture, les mêmes calculs et la même approbation que dans le plugin pour éditeur |
| MCP | Accéder aux outils et aux données externes pendant l’exécution | Agit comme client ; lecture seule par défaut ; les actions attendent votre confirmation |
L’ordre ne change pas : lire correctement, puis intégrer, puis connecter les ressources externes. Si l’ordre d’un niveau est inversé, les chiffres qui suivent ne sont plus fiables.
Aperçu
Pourquoi une lecture correcte est indispensable à l’analyse statistique
Les erreurs statistiques se manifestent rarement par un plantage. Un mauvais séparateur décale toutes les colonnes ; prendre la première ligne pour un en-tête supprime la première observation ; traiter NA et NULL comme 0 modifie la moyenne et la variance ; une colonne numérique lue comme du texte devient un facteur dans un modèle de régression. Rien de tout cela n’arrête le programme. Il renvoie discrètement un chiffre erroné mais plausible — et, puisque l’erreur s’est produite à la lecture, tous les tests, modèles et inférences ultérieurs en héritent.
Pize n’est donc pas optimisé pour faire écrire davantage de code au modèle. Il lui fait d’abord connaître la forme des données, le type de chaque colonne, le nombre de valeurs manquantes et le nombre approximatif de lignes. Le modèle écrit ensuite le code de calcul et de modélisation, puis l’exécute dans votre session réelle afin que vous puissiez en voir les résultats.
Optimisation centrale
Reconnaître et lire les données statistiques
La détection du format examine le contenu, et non l’extension du fichier : dans les données de recherche, un fichier .txt contient souvent un tableau, tandis qu’un fichier .csv peut ne contenir que trois lignes de configuration. Chacune des décisions ci-dessous influe directement sur les résultats obtenus ensuite.
- Détection du séparateur. Le séparateur est choisi parmi la tabulation, la virgule, le point-virgule et la barre verticale (|). Le nombre de colonnes doit rester stable d’une ligne à l’autre et les champs doivent ressembler à des cellules, afin qu’un texte comportant une virgule par phrase ne soit pas interprété comme un tableau à deux colonnes.
- En-tête ou données. Si la première ligne contient encore des chiffres aux emplacements de colonnes numériques, il s’agit d’une observation et non de noms de colonnes. Prendre la première observation pour l’en-tête est une cause classique de perte d’un échantillon.
- Les valeurs manquantes restent hors de l’inférence de type. Les chaînes vides, NA, NaN et NULL sont reconnues séparément ; sinon, une colonne entièrement vide peut être typée comme numérique et amener le modèle à résumer des nombres inexistants.
- Inférence de type colonne par colonne. Numérique / texte / vide, colonne par colonne. Cette étape décide si une colonne peut entrer dans une moyenne, une variance ou une régression.
- Commentaires et métadonnées sont retirés. Les blocs initiaux qui commencent par #, ! ou @XX partent d’abord. VCF cache les noms de colonnes dans la dernière ligne de commentaire ; ils sont récupérés pour que les colonnes aient un nom.
- Les tableaux compressés sont lus de façon transparente. Les fichiers .gz sont décompressés automatiquement ; leur taille est évaluée après décompression — une archive de 1 Mo peut contenir un tableau de 20 Mo.
- Estimation du nombre de lignes. Le total s’estime d’après la part en octets du préfixe déjà lu, et le chiffre est étiqueté comme estimation, pas comme fait.
- Un fichier hors budget reçoit une fiche de données, pas une erreur. Si le budget de contexte est dépassé, Pize renvoie la taille, le séparateur, le nombre estimé de lignes, les noms de colonnes avec leurs types inférés et les deux premières lignes. Le modèle peut alors écrire le bon code de lecture sans qu’un tableau d’un million de lignes n’épuise le contexte.
Conteneurs binaires courants en statistique et recherche
Les données statistiques ne sont souvent pas du texte brut. Joignez Parquet, Feather, Arrow, RDS, RData, h5ad, Loom, HDF5, NumPy, SPSS (.sav), Stata (.dta), SQLite ou DuckDB, et Pize ne répond plus « fichier binaire illisible ». Il indique le format et comment l’ouvrir (par exemple readRDS, anndata.read_h5ad) pour que le modèle écrive le bon code. PDF, DOCX, XLSX et notebooks passent par l’extraction de texte et se lisent de la même façon.
Calcul statistique
Calculer sur des données réelles, pas sur une conjecture
On lit d’abord, on calcule ensuite. Pize n’invente pas de méthodes statistiques à votre place. Il garantit que le modèle voit vos vraies données, et que vous voyez chaque étape.
- Choisir la méthode d’après la distribution réelle. Le modèle reçoit le nombre de lignes et de colonnes, les types, le nombre de valeurs manquantes et les statistiques de synthèse. Il s’en sert pour choisir entre une méthode paramétrique et non paramétrique, décider d’une éventuelle transformation et traiter les valeurs manquantes.
- Écrire, puis exécuter. Le R ou Python généré s’exécute dans la session courante après votre accord. Ce qui revient est une vraie sortie, pas un résultat imaginé.
- Diagnostiquer sur les graphiques. Le dernier graphique peut être récupéré — QQ, résidus, distributions, que l’on ne juge qu’en regardant. Le modèle peut participer à ce jugement.
- Itération fermée. Exécuter, lire, corriger, dans la même session. Les variables intermédiaires ne se perdent pas parce qu’un autre processus a démarré.
- Agrégats seulement, jamais les lignes brutes. Les synthèses de table renvoient structure et statistiques. Les observations brutes restent dans la session.
Capacité d’appui
Pont d’exécution Positron
La vérité d’une analyse n’est pas dans le fichier, elle est en mémoire. Le pont lit, via l’API publique d’extension de Positron, la session R ou Python actuellement au premier plan. Il ne crée ni ne change de runtime. Il n’utilise que celui que vous employez déjà.
Cinq outils
Lire, résumer, exécuter, récupérer les graphiques
| Outil | Rôle | Approbation |
|---|---|---|
| get_session_context | Lire la langue, l’état et la liste des variables de la session (métadonnées seulement) | Classe lecture |
| inspect_variables | Voir la structure et un aperçu tronqué d’une variable par son nom | Classe lecture |
| summarize_table | Nombre de lignes et de colonnes, types, nombre de valeurs manquantes et synthèses d’un data frame | Classe lecture |
| execute_code | Après accord, exécuter du code statistique dans la session courante | Classe commande, désactivé par défaut |
| get_current_plot | Récupérer le dernier graphique pour le modèle | Classe commande, désactivé par défaut |
La frontière de sécurité fait partie de la conception : chaque appel vérifie de nouveau que la session est toujours au premier plan et refuse l’opération si vous en avez changé. Le volume de sortie, le nombre de variables, la longueur de l’aperçu et la taille des images ont des limites strictes ; les lignes de données brutes, l’historique de la console et les secrets ne sont jamais renvoyés. Dans Pize Code, ces cinq outils sont automatiquement absents.
Les pièces jointes viennent du tampon de l’éditeur
Les pastilles sous le champ de saisie lisent le tampon de l’éditeur, pas le fichier périmé sur le disque — le script ou les données que vous venez de changer sans enregistrer sont exactement ce que le modèle voit. Les doublons de même contenu sont dédoublonnés par empreinte.
Ingénierie et fiabilité
La logique de lecture est vérifiée, pas crue
- Tests de non-régression sur des corpus générés. Des échantillons étiquetés sont générés pour 31 formes de fichiers, par lots de dix mille, puis soumis au détecteur. Le premier passage a échoué sur 458 cas et révélé quatre catégories de défauts, corrigées une à une. La graine aléatoire est fixe, ce qui permet de vérifier avec les mêmes entrées que les défauts corrigés ne réapparaissent pas.
- Des tests sentinelles à chaque point d’intégration. Chaque point d’intégration avec le code amont dispose d’un test. Si une fusion supprime une seule ligne de raccordement, le test échoue immédiatement : la fonctionnalité ne peut pas cesser de fonctionner en silence tandis que la suite de tests reste au vert.
- La liste complète à chaque fusion. Des milliers de tests unitaires, deux vérificateurs de types, un lint de tout le dépôt ; après empaquetage, l’artefact s’ouvre pour confirmer que le comportement est bien dedans.
- Auto-contrôle en un clic. Le contrôle de pont de la palette de commandes lit vraiment une session. Un succès prouve que les outils ont atteint de vraies données.
- Coexiste avec la version officielle. Publié sous un identifiant d’extension distinct, installable à côté du plugin amont sans l’écraser.
L’architecture suit une règle constante : tout nouveau comportement est placé dans de nouveaux fichiers, et les fichiers amont ne sont modifiés qu’aux points d’appel nécessaires. Ainsi, une fusion couvrant dix commits amont peut ne produire qu’une seule ligne de conflit. Le projet peut continuer à suivre l’amont au lieu d’être publié une fois puis de rester figé.
Questions
Répondre d’abord à ces sept questions
Qu’est-ce que Pize ?
Pize est un assistant de programmation IA pour le calcul scientifique et l’analyse statistique. Il fonctionne dans Pize Code et Positron, et est également proposé sous forme de SDK.
Qu’est-ce qu’un SDK, et Pize en propose-t-il un ?
Un SDK est un ensemble d’interfaces appelables, de types et d’exemples servant à intégrer une fonctionnalité dans un autre programme. Pize propose un SDK : la même lecture et le même agent, sans être limité à l’éditeur.
Qu’est-ce que MCP, et Pize le prend-il en charge ?
MCP est un protocole ouvert qui permet à un modèle d’accéder à des outils et des données externes. Pize se connecte aux serveurs MCP en tant que client. Les bases de données et les passerelles internes sont accessibles par ce biais. Lecture seule par défaut.
Comment le SDK Pize et MCP fonctionnent-ils avec un modèle d’IA ?
Le modèle raisonne. Le SDK intègre l’agent dans votre produit. MCP lui permet d’accéder à des outils et à des données réels pendant l’exécution. Pize réunit les trois niveaux et place la lecture des données avant eux.
Où fonctionne Pize ?
Dans Pize Code, Positron, avec la CLI et via le SDK.
Pize remplace-t-il Cursor ?
Non. Pize est conçu pour le calcul mathématique et l’analyse statistique. Il se concentre sur la lecture des données et les calculs dans une session active, pas sur un outil générique qui écrit un peu de tout.
Quelles données Pize peut-il lire ?
Pize détecte dans le contenu les délimiteurs, les en-têtes, les valeurs manquantes et les types de colonnes. Au-delà des tableaux de texte, il indique comment ouvrir des formats conteneurs comme Parquet, RDS, h5ad, SPSS et Stata. Les fichiers qui dépassent le budget de contexte reçoivent une fiche de données. La table entière n’est pas insérée dans le contexte.
Installer et commencer
Quatre étapes : d’un jeu de données à une conclusion
Installez le plugin, connectez un modèle et fournissez-lui les données. Il ne reste ensuite qu’à répéter le cycle : écrire le code, l’exécuter, lire les résultats et les graphiques, puis corriger.
Les outils Positron n’apparaissent que dans l’hôte Positron, et sont en lecture seule par défaut. L’exécution de code et la récupération de graphique sont des approbations de classe commande, à activer explicitement. Les nombres de lignes sont des estimations, les synthèses viennent du runtime ; les deux sont sourcés dans le résultat.
Quatre étapes
Installer le plugin Installer l’extension dans Pize Code ou Positron. L’icône Pize apparaît dans la barre latérale.
Connecter un modèle Saisir la clé API de n’importe quel fournisseur, ou indiquer un modèle local et un point de terminaison auto-hébergé.
Lui donner les données Joindre le fichier de données actuel, ou dans Positron focaliser une session déjà chargée.
Planifier, puis agir Valider le plan d’analyse en mode planification. Après accord, laisser Pize écrire et exécuter le code, puis le corriger d’après les graphiques.