Glossaire

Définitions de travail courtes des termes techniques que les exercices utilisent.
Date de publication

14 août 2026

Modifié

17 août 2026

AvertissementTraduction automatique

Ce glossaire a été traduit automatiquement depuis l’original allemand et peut contenir des erreurs. En cas de doute, consultez la version originale.

Ce glossaire explique les termes que les exercices utilisent sans autre explication. Chaque entrée est une définition de travail pour ce cours, et non un article d’encyclopédie. Les exercices disent système d’IA lorsqu’un programme repose sur un grand modèle de langue. Lorsqu’un terme vient de l’anglais, le terme de travail français vient en premier et le terme anglais suit entre parenthèses.

Systèmes d’IA et prompts

Grand modèle de langue (Large Language Model, LLM)

Un grand modèle de langue est un programme informatique qui a appris à partir de très nombreux textes. Pour une entrée donnée, il ajoute le mot suivant le plus probable.

Prompt (consigne de travail)

Un prompt est votre consigne de travail écrite à un système d’IA. Il contient le matériel, le but, les limites et le format de réponse que vous voulez.

Contraintes (Constraints)

Les contraintes sont les limites que vous fixez dans le prompt, par exemple la longueur du texte, les sources autorisées ou les affirmations interdites.

Prompt sans exemples (Zero-shot)

Dans un prompt sans exemples, le système d’IA reçoit seulement la consigne et le matériel, mais aucun exemple de la réponse voulue.

Prompt avec quelques exemples (Few-shot)

Dans un prompt avec quelques exemples, le système d’IA reçoit deux à cinq réponses modèles. Le format et la qualité de la réponse restent ainsi stables.

Trace de raisonnement structurée (Chain-of-Thought)

Une trace de raisonnement structurée est la consigne qui demande au système d’IA d’exposer ses étapes intermédiaires. Ces étapes sont des aides à la vérification, et non des preuves.

Mode de raisonnement intégré (Reasoning Mode)

Dans le mode de raisonnement intégré, le système d’IA produit de lui-même des étapes intermédiaires avant de répondre. Vous n’avez pas prescrit ce déroulement, contrairement à la trace de raisonnement structurée (Wei et al. 2022). Les étapes visibles ne prouvent pas le calcul réel (Turpin et al. 2023).

Déroulement agentique (Agentic Workflow)

Dans un déroulement agentique, le système d’IA planifie plusieurs étapes, appelle des outils et continue sans vous consulter. Une erreur d’une étape précoce se propage dans toutes les étapes suivantes (Kapoor et al. 2024).

Recherche approfondie (Deep Research)

Dans une recherche approfondie, le système d’IA cherche seul sur le web, lit des pages et livre un rapport avec des références. Ce rapport est une liste de résultats et d’hypothèses, et non un état de la littérature vérifié. Les références bibliographiques produites par des systèmes d’IA contiennent des titres inventés et des titres erronés en proportion considérable (Walters et Wilder 2023).

Extraction depuis vos propres documents (Retrieval-Augmented Generation, RAG)

Dans l’extraction depuis vos propres documents, vous déposez une collection de fichiers. Une étape de recherche y choisit des passages et les présente au système d’IA (Lewis et al. 2020). L’extraction élargit donc le contexte. Elle ne garantit pas que la réponse vienne uniquement de votre collection. Utilisez l’extraction pour trouver des passages, et vérifiez chaque affirmation sur l’original.

Lecture multimodale (Multimodal)

Multimodal signifie qu’un système d’IA ne traite pas seulement du texte, mais aussi des images, des enregistrements sonores ou des vidéos. Pour le système, la numérisation d’un dossier est une image. Les modèles d’image généraux lisent l’écriture manuscrite historique nettement moins bien que les modèles spécialisés (Díez García et al. 2025).

Modèle ouvert (Open-Weight Model)

Dans un modèle ouvert, les poids sont librement téléchargeables. Ouvert décrit la licence des poids, et non le lieu d’exécution. Vous pouvez exécuter un modèle ouvert en local, mais aussi chez un fournisseur en ligne. Seul un modèle ouvert vous permet de conserver durablement une version fixe (Spirling 2023).

Modèle local

Un modèle local s’exécute sur votre propre ordinateur. Seul ce cas garantit que votre matériel ne quitte pas cet ordinateur. Local décrit le lieu d’exécution, et non la licence. Le besoin en énergie dépend de la taille du modèle, et non du lieu: un grand modèle local consomme beaucoup d’énergie, un petit modèle pour une tâche étroite en consomme nettement moins (Luccioni et al. 2024).

Hallucination

Une hallucination est une réponse du système d’IA qui paraît plausible, mais qui est fausse ou non étayée.

Biais (Bias)

Un biais est une sélection ou une évaluation unilatérale dans des sources, des données, des modèles, des systèmes de recherche ou des interprétations.

Session (Session)

Une session est une conversation continue avec un système d’IA, dans laquelle le système relit le déroulement antérieur.

Persona

Une persona est un profil court et inventé d’un public cible, avec ses connaissances préalables, ses motifs et ses malentendus possibles.

Traces et vérification

Journal IA (KI-Protokoll)

Le journal IA documente votre usage de l’IA: matériel, prompt, réponse, étapes de vérification et décision. La définition, le modèle et un exemple rempli figurent dans l’exercice Prompt Engineering.

Journal de recherche documentaire (Rechercheprotokoll)

Le journal de recherche documentaire documente votre recherche: date, système, requête, filtres, nombre de résultats et règles de sélection. Il retient comment vous avez cherché, et non comment vous avez utilisé l’IA.

Journal d’analyse de source (Analyseprotokoll)

Le journal d’analyse de source documente une source unique: citation complète, date de consultation, forme d’affichage, critique externe et interne, ainsi que les questions ouvertes. Il décrit la source, et non votre usage de l’IA.

Veto de la source

Le veto de la source signifie ceci: vous rejetez une affirmation du système d’IA lorsque le matériel fourni ou vérifiable ne la couvre pas.

Affirmation (Claim) et identifiant d’affirmation

Une affirmation est un énoncé unique et vérifiable dans votre texte. L’identifiant d’affirmation est son numéro court, par exemple «C3».

Triangulation

La triangulation signifie que vous vérifiez une affirmation avec au moins deux sources indépendantes.

Heuristique

Une heuristique est une règle empirique pour la recherche. Elle mène vite à un résultat utilisable, mais non assuré.

Recherche documentaire

Méthode boule de neige (Snowballing)

Dans la méthode boule de neige, vous suivez les références d’un texte vers l’amont, et vous cherchez vers l’aval les textes qui citent ce texte.

Opérateurs booléens (Boolean)

Les opérateurs booléens sont les mots de recherche AND, OR et NOT. Ils relient ou excluent des termes de recherche dans une base de données.

Troncature

La troncature signifie que vous coupez un mot et que vous cherchez toutes ses formes avec un caractère de remplacement (social* trouve social, sociale et socialisation).

Tri des résultats (Screening)

Dans le tri des résultats, vous vérifiez rapidement la pertinence des résultats et vous les classez en «gardé» ou «rejeté».

Journal des rejets (Reject-Log)

Un journal des rejets retient quels résultats vous avez rejetés et pour quelle raison.

Instruments de recherche

Les instruments de recherche sont les répertoires d’un service d’archives. Ils montrent quels fonds existent et comment ils sont classés.

Écriture et médiation

Livrable (Deliverable)

Un livrable est le produit tangible d’une étape de travail, que vous rendez ou que vous archivez (une liste, un tableau, un texte).

Base de comparaison (Baseline)

Une base de comparaison est un premier résultat simple. Vous mesurez toutes les versions ultérieures à cette base.

Carte des messages (Message Map)

Une carte des messages retient le message central d’une contribution, avec trois ou quatre points d’appui et la signification pour le public cible.

Accroche (Hook)

L’accroche est le premier paragraphe d’une contribution. Elle éveille l’intérêt du public cible.

Technique, données et traces

Informatique minimale (Minimal Computing)

L’informatique minimale désigne des procédés qui demandent peu de puissance de calcul, peu de logiciels et peu d’énergie. Le but est qu’un projet reste exécutable, vérifiable et réutilisable sur le long terme, et sans infrastructure coûteuse.

Logiciel de gestion bibliographique (Zotero)

Un logiciel de gestion bibliographique comme Zotero enregistre vos références et en produit des notes de bas de page et des bibliographies.

BibTeX

BibTeX est un format de fichier pour les références, que les logiciels de gestion bibliographique et les logiciels de composition savent lire.

DOI

Un DOI (Digital Object Identifier) est un numéro permanent pour une publication, qui mène toujours au même emplacement.

Reconnaissance de texte (OCR)

La reconnaissance de texte convertit l’image d’une page en texte interrogeable, et elle commet des erreurs.

Reconnaissance de l’écriture manuscrite (Handwritten Text Recognition, HTR)

La reconnaissance de l’écriture manuscrite convertit une page manuscrite en texte. Pour l’écriture cursive allemande, il existe des modèles généraux avec des taux d’erreur utilisables (Hodel et al. 2021). Le taux d’erreur dépend fortement de l’écriture, de la mise en page, de la langue et de l’état du document (Romein et al. 2025). De telles erreurs modifient toute analyse ultérieure (Strien et al. 2020). Le résultat reste donc une hypothèse de lecture.

Markdown

Markdown est une notation simple, qui marque les titres, les listes et les mises en évidence avec peu de caractères.

Principes FAIR

Les principes FAIR demandent que les données de recherche soient trouvables, accessibles, interopérables et réutilisables. Le texte figure chez GO FAIR et dans Wilkinson et al. (2016).

Principes CARE

Les principes CARE demandent que les données profitent aux communautés concernées et que ces communautés codécident de leurs données. Le texte figure chez la Global Indigenous Data Alliance et dans Carroll et al. (2020).

Droit et protection des données

Les cinq entrées suivantes donnent une orientation, et non un conseil juridique. Le texte de loi et les règles de votre institution font foi.

Données à caractère personnel

Les données à caractère personnel sont des informations sur une personne vivante identifiée ou identifiable. Cela comprend aussi les informations issues d’entretiens, de fonds privés et de fonds soumis à un délai de protection.

Sous-traitant

Un sous-traitant traite des données à caractère personnel uniquement pour le compte du responsable du traitement, selon l’article 4, point 8, du RGPD (Verordnung (EU) 2016/679 zum Schutz natürlicher Personen bei der Verarbeitung personenbezogener Daten (Datenschutz-Grundverordnung) 2016). L’article 4, point 10, du RGPD l’exclut expressément des tiers. Ce rôle suppose un contrat au titre de l’article 28 du RGPD. Un téléversement vers un sous-traitant n’est donc pas une communication à des tiers.

Droit de la protection des données (RGPD et nLPD)

Dans l’Union européenne, le règlement général sur la protection des données régit le traitement des données à caractère personnel. En Suisse, la loi révisée sur la protection des données s’applique (Verordnung (EU) 2016/679 zum Schutz natürlicher Personen bei der Verarbeitung personenbezogener Daten (Datenschutz-Grundverordnung) 2016, Bundesgesetz über den Datenschutz (DSG) 2020). L’article 6 du RGPD exige une base légale pour chaque traitement. Pour la recherche, l’article 89, paragraphe 1, du RGPD impose des garanties appropriées, mais il n’accorde pas de dispense. Certaines obligations peuvent tomber, par exemple l’information au titre de l’article 14, paragraphe 5, point b), du RGPD. Une ligne directrice du Comité européen de la protection des données était en consultation publique en 2026, et elle n’est pas encore du droit applicable (European Data Protection Board 2026).

Hypertrucage (Deepfake)

Selon l’article 3, point 60, du règlement sur l’IA, un hypertrucage est un contenu d’image, de son ou de vidéo généré ou manipulé par l’IA (Verordnung (EU) 2024/1689 zur Festlegung harmonisierter Vorschriften für künstliche Intelligenz (Verordnung über künstliche Intelligenz) 2024). Il présente une ressemblance avec des personnes, des objets, des lieux ou des événements existants, et une personne pourrait le percevoir à tort comme authentique. Une image générée sans ce lien avec la réalité n’est pas un hypertrucage.

Règlement sur l’IA (EU AI Act)

Le règlement sur l’IA de l’Union européenne régit la mise sur le marché et l’utilisation des systèmes d’IA (Verordnung (EU) 2024/1689 zur Festlegung harmonisierter Vorschriften für künstliche Intelligenz (Verordnung über künstliche Intelligenz) 2024). Pour vous, l’article 50 compte avant tout, et il s’applique depuis le 2 août 2026. Comme déployeur, vous indiquez deux choses au titre de l’article 50, paragraphe 4: un hypertrucage, ainsi qu’un texte généré que vous publiez dans le but d’informer le public sur une question d’intérêt public. Pour le texte, l’obligation tombe lorsqu’une personne l’a examiné et assume la responsabilité éditoriale. L’article 50, paragraphe 2, oblige en revanche le fournisseur à marquer les contenus générés dans un format lisible par machine.

Retour au sommet

Les références

Bundesgesetz über den Datenschutz (DSG) (2020). https://www.fedlex.admin.ch/eli/cc/2022/491/de.
Carroll, Stephanie Russo, Ibrahim Garba, Oscar L. Figueroa-Rodríguez, et al. 2020. « The CARE Principles for Indigenous Data Governance ». Data Science Journal 19 (1): 43. https://doi.org/10.5334/dsj-2020-043.
Díez García, Lucía, Paula Terleira Fernández, Valentín Cardeñoso-Payo, André F. Sales Mendes, et Álvaro Lozano Murciego. 2025. « Evaluating Vision Language Models for Handwritten Text Recognition ». In New Trends in Disruptive Technologies, Tech Ethics and Artificial Intelligence. Advances in Intelligent Systems et Computing. Springer Nature Switzerland. https://doi.org/10.1007/978-3-031-99474-6_24.
European Data Protection Board. 2026. Guidelines 1/2026 on Processing of Personal Data for Scientific Research Purposes. Version 1.0. European Data Protection Board. https://www.edpb.europa.eu/our-work-tools/documents/public-consultations/2026/guidelines-12026-processing-personal-data_en.
Hodel, Tobias, David Schoch, Christa Schneider, et Jake Purcell. 2021. « General Models for Handwritten Text Recognition: Feasibility and State-of-the Art. German Kurrent as an Example ». Journal of Open Humanities Data 7 (juillet): 13. https://doi.org/10.5334/johd.46.
Kapoor, Sayash, Benedikt Stroebl, Zachary S. Siegel, Nitya Nadgir, et Arvind Narayanan. 2024. « AI Agents That Matter ». juillet 1. https://doi.org/10.48550/arXiv.2407.01502.
Lewis, Patrick, Ethan Perez, Aleksandra Piktus, et al. 2020. « Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks ». mai 22. https://doi.org/10.48550/arXiv.2005.11401.
Luccioni, Sasha, Yacine Jernite, et Emma Strubell. 2024. « Power Hungry Processing: Watts Driving the Cost of AI Deployment? » Proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24) (New York, NY, USA), juin 3, 85‑99. https://doi.org/10.1145/3630106.3658542.
Romein, Christel Annemieke, Achim Rabus, Gundram Leifert, et Phillip Benjamin Ströbel. 2025. « Assessing Advanced Handwritten Text Recognition Engines for Digitizing Historical Documents ». International Journal of Digital Humanities 7 (1): 115‑34. https://doi.org/10.1007/s42803-025-00100-0.
Spirling, Arthur. 2023. « Why Open-Source Generative AI Models Are an Ethical Way Forward for Science ». Nature 616 (7957): 413. https://doi.org/10.1038/d41586-023-01295-4.
Strien, Daniel van, Kaspar Beelen, Mariona Coll Ardanuy, Kasra Hosseini, Barbara McGillivray, et Giovanni Colavizza. 2020. « Assessing the Impact of OCR Quality on Downstream NLP Tasks ». Proceedings of the 12th International Conference on Agents and Artificial Intelligence (ICAART 2020) (Setúbal), février 22, 484‑96. https://doi.org/10.5220/0009169004840496.
Turpin, Miles, Julian Michael, Ethan Perez, et Samuel R. Bowman. 2023. « Language Models Don’t Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting ». mai 7. https://doi.org/10.48550/arXiv.2305.04388.
Verordnung (EU) 2016/679 zum Schutz natürlicher Personen bei der Verarbeitung personenbezogener Daten (Datenschutz-Grundverordnung), Amtsblatt der Europäischen Union 1 (2016). https://eur-lex.europa.eu/eli/reg/2016/679/oj/deu.
Verordnung (EU) 2024/1689 zur Festlegung harmonisierter Vorschriften für künstliche Intelligenz (Verordnung über künstliche Intelligenz), Amtsblatt der Europäischen Union (2024). https://eur-lex.europa.eu/eli/reg/2024/1689/oj/deu.
Walters, William H., et Esther Isabelle Wilder. 2023. « Fabrication and Errors in the Bibliographic Citations Generated by ChatGPT ». Scientific Reports 13 (1): 14045. https://doi.org/10.1038/s41598-023-41032-5.
Wei, Jason, Xuezhi Wang, Dale Schuurmans, et al. 2022. « Chain-of-Thought Prompting Elicits Reasoning in Large Language Models ». janvier 28. https://doi.org/10.48550/arXiv.2201.11903.
Wilkinson, Mark D., Michel Dumontier, IJsbrand Jan Aalbersberg, et al. 2016. « The FAIR Guiding Principles for scientific data management and stewardship ». Scientific Data 3: 160018. https://doi.org/10.1038/sdata.2016.18.