The Experiment Must Leave a Trace
Research becomes faster when a machine can write code, run an analysis, inspect a result, and propose the next test. The speed is easy to see. The institutional consequence is harder: a laboratory can accumulate more experiments than its people can remember. If each branch disappears into a terminal, a notebook, or a model conversation, the system gains velocity while losing the ability to know why it believes anything.
An OpenAI News RSS item dated September 6 describes coding agents reshaping AI research and points to early data on agent usage, experiment velocity, task complexity, and research acceleration. The description comes from the company’s internal view, so it does not establish a universal productivity measurement; it remains useful because it names the transition directly: agents are moving closer to the machinery of inquiry. Once they write and execute more of the work, the scarce layer is the record that allows a research institution to distinguish a promising result from a fast repetition of an old mistake.
A laboratory does not become more intelligent when it runs more experiments. It becomes more intelligent when each experiment changes what the laboratory can remember and test next.
Speed without memory is only acceleration
Scientific work has always depended on records. A result without method cannot be reproduced. A method without conditions cannot be interpreted. A failed trial that is not recorded will return as a new hypothesis under a different name. The research notebook is therefore more than a place to store observations. It is a device for controlling the relationship between evidence and belief.
Agentic systems put pressure on that relationship because they can produce many plausible branches in a short period. An agent may alter a data-cleaning step, change a model route, run a new analysis, inspect the output, and generate another modification before a human has read the first diff. The central problem concerns both the correctness of the final result and whether anyone can reconstruct the path that made it appear credible.
A useful experiment ledger treats every run as a bounded claim. It records what the researcher expected, what changed, what was held constant, what the system observed, and what decision followed. This structure gives negative results a place beside successful ones. It also prevents a polished final artifact from hiding the branches that were abandoned along the way.
An experiment is a chain, not a result
The final chart or paragraph is only one state in a longer chain. A research-grade record should connect the question to the conditions under which an answer was produced. At minimum, each experiment needs:
- Hypothesis: the claim being tested, including the expected direction and the reason it deserves a test.
- Inputs: the dataset, documents, code, prompts, instruments, permissions, and prior findings available at the start.
- Intervention: the exact change introduced, whether it was a new model route, parameter, transformation, tool, or human instruction.
- Controls: the baselines, comparison groups, fixed conditions, and evaluation measures that make the result interpretable.
- Observations: outputs, errors, anomalies, resource use, and uncertainty, including results that do not support the hypothesis.
- Decision: the next state of the work: continue, revise, suspend, publish, reject, or repeat under a new condition.
These fields make the difference between an experiment and an execution trace. A trace says what the machine did. A ledger says what the action was supposed to establish and what the institution learned from the outcome. The distinction is essential when a research system uses several agents, because each handoff can otherwise detach an action from the question that justified it.
Google’s public description of ADK Go 2.0 supplies a relevant runtime signal. Its graph-based workflow engine includes human-in-the-loop orchestration, dynamic routing, retries, and built-in resilience. Those features can help a laboratory coordinate search, code execution, review, and publication, while scientific memory requires a ledger across the graph and preserve the relationship between a node’s action, the evidence it consumed, and the decision that came after it.
Negative results are part of the institution
Organizations often preserve success more carefully than failure. Published findings receive a title, a citation, and a location. Rejected hypotheses remain in private notes, deleted branches, or the memory of one researcher. This creates a costly asymmetry. The institution remembers what it chose to show and forgets what it already learned not to pursue.
Agentic research will intensify this problem unless the system gives failed branches a durable identity. A null result can reveal that a method is insensitive to a local condition. A failed data transformation can expose a hidden schema assumption. A discarded model route can show that a language, instrument, or population was poorly represented. Such findings are constraints on the next experiment, not editorial waste.
The ledger should therefore preserve rejected branches without confusing them with validated conclusions. A researcher must be able to ask which hypotheses were tested, under which conditions, with what evidence, and why the branch was closed. The answer should include uncertainty and ownership. A future agent can then avoid repeating the test, or reopen it when the data, method, or question has materially changed.
NIST’s AI Risk Management Framework gives this discipline a general vocabulary through Govern, Map, Measure, and Manage. Applied to experiment ledgers, Govern assigns ownership of the question and the record. Map identifies the people, data, systems, and obligations touched by the run. Measure records reproducibility, error, cost, and correction. Manage determines what happens when the result conflicts with prior evidence, the method changes, or a permission expires. The framework is a useful test rather than a laboratory notebook specification: it asks whether the research system can account for its own decisions.
Agents change the rate of inquiry
When a human team runs a small number of experiments, informal memory can appear sufficient. The team meets, compares notes, and carries a shared sense of what has already been tried. That arrangement weakens as agents increase the number of branches. More execution creates more state. More state creates more opportunities for duplicated work, contaminated comparisons, and forgotten assumptions.
The correct response is to make the narration part of the system instead of slowing every experiment until a person has manually narrated it. Agents should be required to declare the hypothesis they are testing, point to the baseline, attach the changed inputs, and record the reason for the next action. Human reviewers can then spend their attention on the meaning of the result rather than reconstructing basic chronology.
This also changes the meaning of research throughput. Counting runs is a weak measure. A better measure asks how many experiments become usable knowledge: how many can be reproduced, how many close a question, how many prevent duplicated work, how quickly a contradiction is surfaced, and how much of the record a new researcher can inherit without interviewing the original operator.
African laboratories must own the record of inquiry
Scientific sovereignty includes control over the memory of investigation. A laboratory that can access a foreign model but cannot export its hypotheses, failed branches, local terminology, evaluation sets, and reasons for rejecting a result has borrowed capability without securing knowledge.
This matters in African research environments where records may cross languages, institutions, funding cycles, and uneven technical infrastructure. A field study may combine community testimony, mobile data, paper forms, satellite imagery, and laboratory measurements. A model may process several of those sources while understanding only one language well. The experiment ledger must retain the original terms, the translation choices, the permissions, and the limits of the inference.
Local ownership means keeping the institutional question and the evidence chain under local authority while using external instruments where they help. An African research center should be able to move a ledger between model providers, audit it with its own reviewers, reproduce a result on available infrastructure, and decide which conclusions enter the public record. The machine can accelerate the inquiry while the institution retains the power to define what counts as knowledge.
Cheikh Anta Diop’s scientific method has a direct contemporary lesson here. Historical and scientific independence require more than access to instruments produced elsewhere. They require the capacity to compare evidence, expose assumptions, preserve the record, and build conclusions that can be tested by others. An experiment ledger is a small institution for that work. It gives a laboratory a memory that is structured enough to resist both erasure and false certainty.
Where the investable surface is widening
If coding agents increase the rate of inquiry, capital should examine the infrastructure that turns experimental activity into inheritable research capacity:
- Experiment registries: systems that assign identity, version, ownership, status, and searchable relationships to hypotheses and runs.
- Reproducibility runners: environments that snapshot code, data, model routes, dependencies, and permissions, then replay a result under declared conditions.
- Branch and null-result management: tools that preserve rejected hypotheses and failed methods as reusable constraints without presenting them as validated findings.
- Agent research control planes: orchestration layers that require hypothesis declarations, baseline references, approval gates, resource limits, and evidence-bearing handoffs.
- Local scientific memory: multilingual, exportable systems that retain terminology, community permissions, evaluation sets, and institutional ownership across providers.
The underwriting question is concrete: does the product increase the amount of research that a new person, agent, or institution can reproduce and extend? Useful measures include reconstruction time, duplicate-experiment rate, percentage of runs with a declared baseline, share of negative results that remain discoverable, time to identify a contradictory finding, and the fraction of records that can be exported and replayed outside the original provider.
This is a different commercial object from a generic research assistant, a finished-artifact registry, or a workflow graph. Those products help a system answer, preserve an output, or route work. The experiment ledger preserves the institution’s changing map of what it tried, what failed, what remains uncertain, and why the next question is worth asking.
Build the ledger before adding another agent
A laboratory can test this architecture with one bounded research question. Before increasing the number of agents, make the inquiry legible:
- Write the hypothesis, expected observation, decision threshold, and owner before the run begins.
- Snapshot the inputs, code, model route, tools, permissions, and baseline used by the experiment.
- Require the system to record interventions, outputs, errors, resource use, and uncertainty as the run proceeds.
- Store successful, inconclusive, and rejected branches with distinct states and reasons.
- Reproduce one result on a second environment or provider, then record the differences rather than hiding them.
These practices make speed accountable without making inquiry timid. They let agents explore more branches while keeping a human institution able to inspect the question, challenge the method, and inherit the conclusion. They also create a better boundary for capital: the buyer can evaluate whether the system produces durable research capacity instead of merely a larger stream of machine activity.
The experiment must leave a trace because a laboratory is built from remembered questions as much as from published answers. When every branch has a place, failure becomes evidence, and the next generation can begin from the real frontier rather than from the fragments that survived.
Sources
- OpenAI News RSS: “Research acceleration: The view inside OpenAI” (September 6, 2026; linked article: https://openai.com/index/research-acceleration-view-inside-openai; description: coding agents are reshaping AI research, with early data on agent usage, experiment velocity, task complexity, and research acceleration).
- Google Developers Blog: “Build reliable multi-agent applications with ADK Go 2.0” (June 30, 2026; description: a graph-based workflow engine with human-in-the-loop orchestration, dynamic routing, retries, and built-in resilience).
- National Institute of Standards and Technology: “AI Risk Management Framework” (page published July 12, 2021; accessed September 7, 2026; functions: Govern, Map, Measure, and Manage).
L’expérience doit laisser une trace
La recherche devient plus rapide lorsqu’une machine peut écrire du code, exécuter une analyse, examiner un résultat et proposer le test suivant. La vitesse se voit facilement. La conséquence institutionnelle est plus difficile à saisir : un laboratoire peut accumuler plus d’expériences que ses membres ne peuvent en retenir. Si chaque branche disparaît dans un terminal, un carnet ou une conversation avec un modèle, le système gagne en vitesse tout en perdant la capacité de savoir pourquoi il croit quoi que ce soit.
Un item du flux RSS d’OpenAI daté du 6 septembre décrit des agents de codage qui remodèlent la recherche en IA et signale des données préliminaires sur l’usage des agents, la vitesse des expériences, la complexité des tâches et l’accélération de la recherche. Cette description fournie par l’entreprise d’un état interne n’établit pas une mesure universelle de productivité, mais elle reste utile parce qu’elle nomme directement la transition : les agents se rapprochent de la mécanique de l’enquête. Lorsqu’ils écrivent et exécutent une plus grande partie du travail, la couche rare devient le dossier qui permet à une institution de recherche de distinguer un résultat prometteur de la répétition rapide d’une ancienne erreur.
Un laboratoire ne devient pas plus intelligent parce qu’il mène davantage d’expériences. Il devient plus intelligent lorsque chaque expérience modifie ce qu’il peut retenir et tester ensuite.
La vitesse sans mémoire n’est qu’une accélération
Le travail scientifique a toujours dépendu de dossiers. Un résultat sans méthode ne peut pas être reproduit. Une méthode sans conditions ne peut pas être interprétée. Un essai échoué qui n’est pas consigné reviendra comme une nouvelle hypothèse sous un autre nom. Le carnet de recherche est donc davantage qu’un lieu de stockage des observations. C’est un instrument qui contrôle la relation entre les preuves et les convictions.
Les systèmes agentiques exercent une pression sur cette relation parce qu’ils peuvent produire de nombreuses branches plausibles en peu de temps. Un agent peut modifier une étape de nettoyage des données, changer un parcours de modèle, lancer une nouvelle analyse, examiner la sortie et générer une autre modification avant qu’un humain n’ait lu le premier diff. La question centrale porte à la fois sur la correction du résultat final et sur la possibilité pour quiconque de reconstituer le chemin qui l’a rendu crédible.
Un registre d’expériences utile traite chaque exécution comme une affirmation bornée. Il consigne ce que le chercheur attendait, ce qui a changé, ce qui est resté constant, ce que le système a observé et la décision qui a suivi. Cette structure donne aux résultats négatifs une place à côté des résultats positifs. Elle empêche aussi qu’un artefact final soigné dissimule les branches abandonnées en cours de route.
Une expérience est une chaîne, pas un résultat
Le graphique ou le paragraphe final n’est qu’un état dans une chaîne plus longue. Un dossier de niveau scientifique doit relier la question aux conditions dans lesquelles une réponse a été produite. Chaque expérience doit au minimum comprendre :
- Hypothèse : l’affirmation testée, avec la direction attendue et la raison pour laquelle elle mérite un test.
- Entrées : jeu de données, documents, code, prompts, instruments, permissions et résultats antérieurs disponibles au départ.
- Intervention : changement exact introduit, qu’il s’agisse d’un nouveau parcours de modèle, paramètre, transformation, outil ou instruction humaine.
- Contrôles : références, groupes de comparaison, conditions fixes et mesures d’évaluation qui rendent le résultat interprétable.
- Observations : sorties, erreurs, anomalies, consommation de ressources et incertitude, y compris les résultats qui ne soutiennent pas l’hypothèse.
- Décision : état suivant du travail : poursuivre, réviser, suspendre, publier, rejeter ou répéter sous une nouvelle condition.
Ces champs font la différence entre une expérience et une simple trace d’exécution. Une trace dit ce que la machine a fait. Un registre dit ce que l’action devait établir et ce que l’institution a appris du résultat. La distinction est essentielle lorsqu’un système de recherche utilise plusieurs agents, car chaque transfert peut sinon détacher une action de la question qui la justifiait.
La description publique de Google consacrée à ADK Go 2.0 fournit ici un signal d’exécution pertinent. Son moteur de workflow en graphe comprend une orchestration avec humain dans la boucle, un routage dynamique, des nouvelles tentatives et une résilience intégrée. Ces fonctions peuvent aider un laboratoire à coordonner la recherche documentaire, l’exécution du code, la revue et la publication ; la mémoire scientifique exige toutefois un registre qui traverse le graphe et conserver la relation entre l’action d’un nœud, les preuves qu’il a utilisées et la décision qui a suivi.
Les résultats négatifs appartiennent à l’institution
Les organisations conservent souvent les succès avec davantage de soin que les échecs. Les résultats publiés reçoivent un titre, une citation et un emplacement. Les hypothèses rejetées restent dans des notes privées, des branches supprimées ou la mémoire d’un seul chercheur. Cette asymétrie coûte cher. L’institution se souvient de ce qu’elle a choisi de montrer et oublie ce qu’elle avait déjà appris à ne pas poursuivre.
La recherche agentique intensifiera ce problème si le système ne donne pas une identité durable aux branches échouées. Un résultat nul peut révéler qu’une méthode est insensible à une condition locale. Une transformation de données échouée peut exposer une hypothèse cachée du schéma. Un parcours de modèle abandonné peut montrer qu’une langue, un instrument ou une population était mal représenté. Ces résultats constituent des contraintes pour le test suivant, et non des déchets éditoriaux.
Le registre doit donc conserver les branches rejetées sans les confondre avec des conclusions validées. Un chercheur doit pouvoir demander quelles hypothèses ont été testées, dans quelles conditions, avec quelles preuves et pourquoi la branche a été fermée. La réponse doit inclure l’incertitude et la responsabilité. Un agent futur peut alors éviter de répéter le test ou le rouvrir lorsque les données, la méthode ou la question ont changé de manière substantielle.
Le cadre de gestion des risques liés à l’IA du NIST donne à cette discipline un vocabulaire général avec Govern, Map, Measure et Manage. Appliqué aux registres d’expériences, Govern attribue la responsabilité de la question et du dossier. Map identifie les personnes, données, systèmes et obligations touchés par l’exécution. Measure consigne la reproductibilité, l’erreur, le coût et la correction. Manage détermine ce qui se passe lorsque le résultat contredit les preuves antérieures, que la méthode change ou qu’une permission expire. Le cadre fournit un test utile plutôt qu’une spécification de carnet de laboratoire : il demande si le système de recherche peut rendre compte de ses propres décisions.
Les agents modifient le rythme de l’enquête
Lorsqu’une équipe humaine mène un petit nombre d’expériences, la mémoire informelle peut sembler suffisante. L’équipe se réunit, compare ses notes et conserve une intuition commune de ce qui a déjà été tenté. Cette organisation se fragilise lorsque les agents augmentent le nombre de branches. Davantage d’exécution crée davantage d’états. Davantage d’états crée davantage de risques de travail dupliqué, de comparaisons contaminées et d’hypothèses oubliées.
La bonne réponse consiste à intégrer le récit au système au lieu de ralentir chaque expérience jusqu’à ce qu’une personne la raconte manuellement. Les agents doivent déclarer l’hypothèse testée, désigner la référence, joindre les entrées modifiées et consigner la raison de l’action suivante. Les réviseurs humains peuvent ainsi consacrer leur attention au sens du résultat plutôt qu’à la reconstitution de sa chronologie élémentaire.
Cela modifie également le sens du débit de recherche. Compter les exécutions est une mesure faible. Une mesure plus solide demande combien d’expériences deviennent un savoir utilisable : combien peuvent être reproduites, combien ferment une question, combien empêchent un travail dupliqué, à quelle vitesse une contradiction est détectée et quelle part du dossier un nouveau chercheur peut recevoir sans interroger l’opérateur initial.
Les laboratoires africains doivent posséder le dossier de l’enquête
La souveraineté scientifique comprend le contrôle de la mémoire de l’investigation. Un laboratoire qui peut accéder à un modèle étranger mais qui ne peut pas exporter ses hypothèses, ses branches échouées, sa terminologie locale, ses jeux d’évaluation et les raisons du rejet d’un résultat a emprunté une capacité sans sécuriser le savoir.
La question est importante dans des environnements de recherche africains où les dossiers peuvent traverser les langues, les institutions, les cycles de financement et des infrastructures techniques inégales. Une étude de terrain peut combiner témoignages communautaires, données mobiles, formulaires papier, imagerie satellitaire et mesures de laboratoire. Un modèle peut traiter plusieurs de ces sources tout en ne maîtrisant correctement qu’une seule langue. Le registre doit conserver les termes originaux, les choix de traduction, les permissions et les limites de l’inférence.
La propriété locale signifie conserver la question institutionnelle et la chaîne de preuves sous une autorité locale tout en utilisant les instruments extérieurs là où ils sont utiles. Un centre de recherche africain doit pouvoir déplacer un registre entre fournisseurs de modèles, le faire auditer par ses propres réviseurs, reproduire un résultat sur l’infrastructure disponible et décider quelles conclusions entrent dans le dossier public. La machine peut accélérer l’enquête tandis que l’institution garde le pouvoir de définir ce qui compte comme savoir.
La méthode de Cheikh Anta Diop offre ici une leçon contemporaine directe. L’indépendance historique et scientifique exige davantage que l’accès à des instruments produits ailleurs. Elle exige la capacité de comparer les preuves, d’exposer les hypothèses, de conserver le dossier et de bâtir des conclusions que d’autres peuvent tester. Un registre d’expériences est une petite institution pour ce travail. Il donne au laboratoire une mémoire assez structurée pour résister à la fois à l’effacement et à la fausse certitude.
Où la surface d’investissement s’élargit
Si les agents de codage augmentent le rythme de l’enquête, le capital doit examiner l’infrastructure qui transforme l’activité expérimentale en capacité de recherche transmissible :
- Registres d’expériences : systèmes attribuant une identité, une version, un responsable, un statut et des relations consultables aux hypothèses et aux exécutions.
- Environnements de reproductibilité : environnements qui instantanent le code, les données, les parcours de modèle, les dépendances et les permissions, puis rejouent un résultat dans des conditions déclarées.
- Gestion des branches et des résultats nuls : outils conservant les hypothèses rejetées et les méthodes échouées comme contraintes réutilisables sans les présenter comme des résultats validés.
- Plans de contrôle pour la recherche agentique : couches d’orchestration exigeant des déclarations d’hypothèse, des références de base, des seuils d’approbation, des limites de ressources et des transferts porteurs de preuves.
- Mémoire scientifique locale : systèmes multilingues et exportables qui retiennent la terminologie, les permissions communautaires, les jeux d’évaluation et la propriété institutionnelle entre les fournisseurs.
La question de souscription est concrète : le produit augmente-t-il la quantité de recherche qu’une nouvelle personne, un nouvel agent ou une nouvelle institution peut reproduire et prolonger ? Les mesures utiles comprennent le temps de reconstitution, le taux d’expériences dupliquées, la part des exécutions dotées d’une référence déclarée, la part des résultats négatifs qui restent découvrables, le délai d’identification d’un résultat contradictoire et la proportion de dossiers exportables et rejouables en dehors du fournisseur initial.
Il s’agit d’un objet commercial différent d’un assistant de recherche générique, d’un registre d’artefacts terminés ou d’un graphe de workflow. Ces produits aident un système à répondre, à conserver une sortie ou à router le travail. Le registre d’expériences conserve la carte changeante de l’institution : ce qu’elle a essayé, ce qui a échoué, ce qui demeure incertain et pourquoi la prochaine question mérite d’être posée.
Construire le registre avant d’ajouter un autre agent
Un laboratoire peut tester cette architecture avec une question de recherche bornée. Avant d’augmenter le nombre d’agents, il faut rendre l’enquête lisible :
- Écrire l’hypothèse, l’observation attendue, le seuil de décision et le responsable avant le début de l’exécution.
- Instantaner les entrées, le code, le parcours de modèle, les outils, les permissions et la référence utilisés par l’expérience.
- Exiger du système qu’il consigne au fil de l’exécution les interventions, sorties, erreurs, ressources utilisées et incertitudes.
- Stocker les branches fructueuses, indécises et rejetées avec des états et des raisons distincts.
- Reproduire un résultat dans un second environnement ou chez un second fournisseur, puis consigner les différences au lieu de les cacher.
Ces pratiques rendent la vitesse responsable sans rendre l’enquête timide. Elles permettent aux agents d’explorer davantage de branches tout en conservant à une institution humaine la capacité d’examiner la question, de contester la méthode et de recevoir la conclusion. Elles créent aussi une meilleure frontière pour le capital : l’acheteur peut évaluer si le système produit une capacité de recherche durable plutôt qu’un flux plus important d’activité machine.
L’expérience doit laisser une trace parce qu’un laboratoire se construit autant avec les questions retenues qu’avec les réponses publiées. Lorsque chaque branche possède une place, l’échec devient une preuve et la génération suivante peut commencer au véritable front de recherche plutôt qu’à partir des fragments qui ont survécu.
Sources