ORIGINA world made for AI为 AI 而造的世界為 AI 而造的世界AIのためにつくられた世界AI를 위해 만든 세계Un mundo hecho para la IAUn mundo hecho para la IAUm mundo feito para IAUn monde fait pour l’IAEine Welt für KIМир, созданный для ИИعالم صُنع للذكاء الاصطناعي
Menu菜单選單メニュー메뉴MenúMenúMenuMenuMenüМенюالقائمة
All research全部研究全部研究すべての研究모든 연구Toda la investigaciónToda la investigaciónToda a pesquisaToutes les recherchesAlle ForschungВсе исследованияكل الأبحاث

Agents / Memory智能体 / 记忆智慧體 / 記憶エージェント / 記憶에이전트 / 기억Agentes / MemoriaAgentes / MemoriaAgentes / MemóriaAgents / MémoireAgenten / GedächtnisАгенты / Памятьالوكلاء / الذاكرةTECHNICAL REPORT / 01

Finite Memory and Delayed Obligations有限记忆与延迟义务有限記憶與延遲義務有限の記憶と遅れて果たされる義務유한한 기억과 지연된 의무Memoria finita y obligaciones diferidasMemoria finita y obligaciones diferidasMemória finita e obrigações adiadasMémoire finie et obligations différéesBegrenztes Gedächtnis und verzögerte VerpflichtungenКонечная память и отложенные обязательстваذاكرة محدودة والتزامات مؤجلة

Original title原题原題原題원제Título originalTítulo originalTítulo originalTitre originalOriginaltitelОригинальное названиеالعنوان الأصلي Finite Memory and Delayed Obligations

A recorded software test of resident behavior一份关于居民行为的软件测试报告一份關於居民行為的軟體測試報告住民の行動に関するソフトウェア試験の記録거주자 행동에 대한 소프트웨어 시험 기록Una prueba de software registrada sobre el comportamiento de un residenteUna prueba de software registrada sobre el comportamiento de un residenteUm teste de software registrado do comportamento de um residenteUn test logiciel enregistré du comportement d’un résidentEin aufgezeichneter Softwaretest zum Verhalten eines BewohnersЗаписанный программный тест поведения жителяاختبار برمجي مسجّل لسلوك مقيم

16 min read约 16 分钟約 16 分鐘読了目安 16分읽는 데 약 16분16 min de lectura16 min de lecturaLeitura de 16 min16 min de lecture16 Min. Lesezeit16 минут чтенияقراءة في 16 دقيقةEnglish original由英文原稿译出由英文原稿譯出英語原文の翻訳영어 원문의 번역Traducción del original inglésTraducción del original en inglésTradução do original em inglêsTraduction de l’original anglaisÜbersetzung des englischen OriginalsПеревод с английского оригиналаترجمة عن الأصل الإنجليزيTechnical report · Internal draft技术报告 · 内部草稿技術報告 · 內部草稿テクニカルレポート · 内部ドラフト기술 보고서 · 내부 초안Informe técnico · Borrador internoReporte técnico · Borrador internoRelatório técnico · Rascunho internoRapport technique · Brouillon interneTechnischer Bericht · Interner EntwurfТехнический отчёт · Внутренний черновикتقرير تقني · مسودة داخلية

Abstract

Limited memory can change an agent's future actions, but storing a past failure does not establish learning or guarantee that the information will be used. We examine an existing ORIGIN apparatus in which two deterministic selectors expose different past experiences to a fixed decision rule. One resident acts in an authored resource-constrained catchment for 16 decisions and must finish with at least five reserve units. Both selectors permit two records and at most 8192 canonical UTF-8 bytes. The archived responsive-priority episode reaches the obligation; its recency counterpart does not. Two controls that ignore selected memory follow identical action/state sequences and both miss the obligation. The decisive dependency is explicitly authored: recency retains an observed obstruction cue, but the rule's decision-5 branch responds specifically to a remembered stalled collect. The report therefore documents a bounded mechanism and its verification limits. It does not estimate a population effect or demonstrate LLM learning, motivation, survival, or cross-species equivalence. We preserve separate null/adverse development comparisons and specify what a later empirical study would need.

Terms

ORIGIN
Proper name of the project. Not translated.
Sol-III
Proper name of the authored catchment world. Not translated.
delayed obligation
A requirement scored only after decision 15: final reserve at least five. Crossing five earlier is not completion.
stalled collect
A collect action followed by no visible increase in reserve, including a decrease. The selector predicate; it does not name a hidden cause. Source identifier: stalledCollect.
selector
The policy that chooses which archived records a resident may see. Here: priority versus recency, each capped at two records and 8192 UTF-8 bytes.
apparatus
The completed deterministic fixture already on record: world, selectors, provider, verifier, and saved episodes. This report reads it; it does not rerun it.
resident
The acting agent in the catchment. It is not a biological organism and zero reserve is not death.
reserve
The finite resource counter in the authored world. The delayed obligation requires final reserve ≥ 5.

1. The question and the evidence

The research question is whether prioritizing a resident's own observed failed-action experiences over recent experiences, at the same memory capacity, changes completion of a delayed obligation—and under which conditions remembering those experiences leaves behavior unchanged. The present answer is limited to an already completed deterministic apparatus. It is useful because selected information, rule-dependent action, authoritative world change, and outcome can be examined separately.

The apparatus was completed before this research intake. This report reads its source, accepted records, seven saved episodes, and derived decision table. It adds a source/record audit and figures derived from those saved data. It does not execute the world, a Go test or verifier, a live model, or a hardware experiment. Four external research memos supplied candidate questions and sources; their answers are not empirical evidence. The companion claim/source table distinguishes original findings, local observations, hypotheses, and unverified leads.

“Failure” requires an operational definition. The selector's predicate is a collect action followed by no visible increase in reserve, including a decrease. It does not identify a concealed causal explanation or assert that the action was rejected. “Delayed” refers to consequences of earlier actions that affect later resource availability and to an obligation evaluated only after decision 15. “Long-term” denotes this finite horizon; it does not mean indefinite deployment. These definitions follow the implemented selector and apparatus contract.

2. The completed apparatus

The existing Sol-III current catchment is an authored, dimensionless world. Its source defines initial reserve 4, effort 1, stored resource 2, and an obstruction. Reserve, effort, and store have finite caps. The resident chooses among inspect, collect, clear, and rest. Clearing changes the obstacle state and thereby later rain capture. Current perception exposes reserve, effort, and an observation reading; it does not directly expose every world variable. The resource and lifecycle declarations do not turn zero reserve into death: residents can continue acting at zero. The measured endpoint is therefore provisioning at a deadline, not survival. These are source-level descriptions of world.go, not claims of biological realism.

Every memory record binds one resident's actual pre-action perception, its chosen action, and the delivered post-action perception to an episode/run lineage. Only complete prior records are eligible. The priority selector first ranks collects with non-positive observed reserve change, then fills by recency. The comparator ranks by recency alone. Both return selected records chronologically, skip oversized candidates, and cap the entire selected array at two records and 8192 bytes. Selection does not update model weights. The host retains the larger archive and omission evidence; the resident-facing memory budget applies to the selected exposure, not to total computer storage.

Both responsive arms use the same stateless authored provider. Its rule has an explicit clock: at decision 5, corresponding to eleven remaining decisions including the current one, it clears only if visible effort is at least three and selected memory contains a stalled collect. It rests through the middle interval and collects with positive effort during the final four decisions. Other earlier branches respond to memory and current perception. Thus the experiment does not ask a model to discover a strategy. The provider source makes the dependency inspectable.

Two insensitive controls collect when current effort is positive and otherwise rest, without using selected memory. Three literal schedules check a successful path, that path with decision-5 clearing replaced by rest, and all-rest behavior. The delayed goal is satisfied only when a complete, valid 16-decision episode has final reserve at least five. Crossing five earlier is insufficient.

The recorded verifier reconstructs correspondence among manifests, journals, attempts, requests, selected memories, actions, observations, and final facts before scoring. It is provider-free; the resident itself still uses an authored provider. A valid missed obligation is distinct from invalid or incomplete evidence. This distinction prevents a goal failure from being silently discarded as an invalid record and prevents a well-formed trace from being mistaken for a successful outcome.

3. Results in the saved conditions

The seven recorded conditions each contain 16 decisions. Their 112 decision rows are nested measurements, not 112 independent samples. The following values were read from saved run/verification summaries and checked against the corresponding extracted final states. They are descriptive fixed-condition results, with no sampling-based interval or p-value. Saved results, decision extraction.

ConditionFinal reserveTerminal obligation
responsive-priority5Met
responsive-recency0Missed
insensitive-priority0Missed
insensitive-recency0Missed
literal-success-priority5Met
literal-no-clear-priority0Missed
literal-all-rest-priority0Missed
Reserve after each of 16 decisions for responsive and memory-insensitive selector pairs. Scroll horizontally to inspect.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Figure 1. Existing authored trajectories. The responsive pair differs at the clearing decision and later in reserve. The insensitive pair has identical actions and states. The requirement applies only at decision 15; reserve five at decision zero is not completion. Lines connect recorded decision states and do not denote additional observations.

At decision 5, priority retains experiences [1,4] and clears; recency retains [3,4] and rests. Their selected memory arrays contain 2693 and 2692 bytes respectively, and captured Petition JSON sizes are 5039 and 5038 bytes. Equal capacity limits therefore do not imply identical byte counts or LLM token costs. These are bytes, not tokenizer measurements. The source and saved selection establish a two-record bottleneck at this boundary; they do not establish a binding 8192-byte bottleneck.

The two responsive episodes end with reserve 5 and 0. Their literal counterparts yield the same reserve trajectories; replacing clearing with rest changes the delayed outcome in the authored fixture. The two insensitive episodes have identical 16-step action/state sequences despite different selected memories. This is a control for the specified decision rule, not a general result that memory cannot matter.

4. What the difference identifies

The strongest supported interpretation is conditional: changing the selection policy changes the information supplied to this fixed responsive rule, its decision-5 action, and the saved downstream outcome. The dependence is engineered into the rule. The result does not identify an intrinsically superior memory representation or spontaneous learning.

A critical detail is visible in the saved recency carrier. Its decision-5 selected-memory bytes include experience 3, an inspect action whose post-observation has reading: 1, the observed obstruction signal. The provider computes a flag from such post-observations, but the eleven-remaining-decisions branch checks stalledCollect instead. It does not use that obstruction flag to trigger clearing at this boundary. Consequently, the losing recency arm cannot be described as having no potentially useful warning. This is a direct source/record observation; the proposition that another policy would exploit the cue is a plausible alternative explanation to test, not a new experiment performed here. Saved recency carrier, responsive rule.

The insensitive comparison also has a retained correction. An initial control expected different presence/absence of stalled collects, but both arms retained one. The corrected control concerned different retained experiences with identical world trajectories. Retaining the original failed expectation prevents a mistaken control story from being converted into a positive result. The accepted apparatus record documents that history.

No condition in this set isolates the necessity of delay or scarcity by varying them. The report describes a mechanism operating in their presence. It does not claim the same selector contrast depends uniquely on either feature, or that it persists under obsolete failures, changed prerequisites, different policies, or unexamined worlds.

5. Verification is itself an object of evidence

Provider execution and strict replay share an authored rule. Their agreement can establish consistency while missing a shared deviation from the documented contract. A preserved private wrong variant shortened the final collection window from four decisions to three; that copy's strict verification accepted the episode, while decision 12 returned inspect rather than the independently expected collect. The original product rule was correct. The changed-policy reserve of four is not an adverse selector result.

An additive test then supplied twelve literal expectations spanning decisions 11, 12, and 15, positive/zero effort, and empty/retained stalled-collect memory. Historical logs record the unmodified control passing and three compiling wrong variants failing the intended assertions. In this research intake, all eight implementation log hashes and the current test-file hash matched their recorded values, and the relevant failing-choice messages were inspected. These are fresh integrity/reading checks of historical evidence, not freshly executed tests. Acceptance audit, literal test, recorded commands and logs.

Current byte checks also matched all 140 saved episode files against the seven existing receipts and all 95 archived source/module entries against the responsive-priority manifest. This supports integrity of the inspected package. It does not attest which binary originally executed, establish that every compiler input is archived, or replace a fresh independent reproduction. The report preserves the documented source-discovery limitation: compiled use requires the source checkout at its build path and a build without -trimpath. Full infrastructure, crash-recovery, and repository-wide correctness claims remain outside this record.

6. Separate earlier development evidence

The older paper-readiness dataset contains eight authored trajectories, 128 nested moments, and four adaptive/baseline profile comparisons. Its metric is the sum of carried reserve after each ProcessMoment over moments 0–15, measured in reserve-unit moments. The adaptive-minus-baseline differences are +4, 0, 0, and −1. They are not the priority/recency intervention above, and they do not share its terminal endpoint. Definitions, four comparisons.

Four earlier development profile differences: current plus four, shifted zero, clustered zero, sparse minus one. Scroll horizontally to inspect.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Figure 2. All four earlier fixed profile comparisons, using their original cumulative metric. The adverse and zero values are retained. This figure is separate development context; it is not additional sampling for Figure 1.

Two historical local-model feasibility trials and two apparatus-topology rows are also catalogued in that older intake. None can be added to the seven deterministic conditions to enlarge a behavioral sample. Replays, retries, rescoring, and multiple rows from one trajectory retain their lineage. The older current, shifted, clustered, and sparse profiles have already been inspected and cannot become a blind holdout by renaming them.

7. Position in the literature

Memory systems combine interventions that should be distinguished. Generative Agents combines retrieval factors including access-based recency, importance, and relevance; its interview ablations use histories accumulated by the full architecture. That evaluation motivates separating common-history decision probes from complete trajectory interventions. It does not validate this catchment result. Park et al., 2023, §§4.1 and 6.1–6.2.

Reflexion changes subsequent context through textual feedback rather than changing base-model weights. Its WebShop appendix also reports a setting in which the attempted improvement did not materialize. Both the mechanism and that limitation argue against treating memory or reflection as an unconditional benefit. They concern different tasks and trial structures from this apparatus. Shinn et al., 2023, abstract and Appendix B.1.

For a later empirical study, sample size must follow an inferential objective and justified assumptions. Precision-based planning, for example, requires a target interval width and an account of variability; no paper supplies a universal sufficient number of ORIGIN runs. Lakens, 2022, “Planning for Precision”.

Artifact availability/functionality and independently obtained results are separate achievements in ACM's artifact terminology. This report offers a local integrity audit and a reproducible figure derivation; it does not claim a review badge or an independent experimental replication. ACM SIGIR artifact criteria.

LongMemEval evaluates reading strategies with oracle-retrieved evidence, showing that reader design affects QA performance even when the evidence sessions are supplied. This strengthens the distinction between retrieval and use, within a chat-history QA task. It does not measure persistent-world action. Wu et al., v2, §5.5.

XENON couples experience memory to dependency correction and candidate-action correction. It is therefore a reference for a different intervention from changing episode exposure while keeping this apparatus's chooser fixed. Lee et al., v3, §§4.1–4.2.

Vending-Bench separates recent-context limits from external memory tools without explicit storage constraints. Its original GPT-4o-mini context-capacity ablation reports worse outcomes with larger limits. This cautions against treating every memory layer as one budget or assuming monotonic benefit; its business domain and historical models are not ORIGIN results. Backlund and Petersson, v1, §§2.1 and 3.5.2.

The few-run RL analysis by Agarwal and colleagues concerns variability across stochastic training/evaluation runs. Its statistical recommendations require an appropriate sampling structure and do not supply confidence intervals for these seven authored conditions. Agarwal et al., NeurIPS 2021.

Human/nonhuman and compute/quantum findings remain separate portfolio inputs, not evidence for the present result. The source adjudication records the admitted scope and corrections to over-narrow or incomplete collection summaries.

8. A falsifiable continuation

A next empirical question could ask whether the selector contrast changes complete-episode goal probability for a declared model/task distribution. The direction must remain open. A useful negative result would retain a relevant failure record without improving the chosen action or terminal outcome; a harmful result would also be informative. The present source inspection additionally motivates distinguishing retention from the decision rule's cue-use contract.

Before any collection, define the eligible observations, accessible storage and per-decision exposure, selector/tie/overflow rules, delivered prompts, model and requested/reported version, resource limits, world/initial-state distribution, protected holdout, deadline, independent scorer expectations, failure/retry lineage, stopping rule, and primary analysis. Match the permitted resource ceilings while reporting actual consumption. Do not force post-intervention world/observation trajectories to remain equal; those differences may carry the effect being studied.

Use complete episodes as units, with declared task blocks or pairs. Shared worlds with interacting residents require group/world units. State the denominator for all launched episodes and the treatment of unavailable outcomes before looking at results. A common seed does not guarantee corresponding model randomness after trajectories diverge. Choose a meaningful effect or precision target and assess sample-size sensitivity under defensible assumptions; these quantities remain unset here. This is a proposed study, not a preregistration or a completed empirical result.

9. Reproduction and availability

The underlying source and runtime records remain private. This reading edition preserves the internally reviewed draft's scientific claims and recorded values. Local source and audit references in the text name records in that private package; they are not public artifact links.

The two SVG figures are redrawn from the accepted extraction and comparison values for this website. Figure values are available for inspecting the plotted points. Rebuilding a figure is different from replaying the world. These derived values do not replace the underlying source, episode records, and independent scorer.

A public research release still requires accountable authorship, a frozen source/data and redaction bundle, stable artifact links, and review of that release package. Those have not been assigned or released here. The completed internal review covers the technical manuscript and its figures; it is not journal peer review or independent apparatus execution. Corrections remain part of the research record.

Revision history

9 September 2026. Website reading edition of the internally reviewed technical draft. The scientific claims and recorded values are retained. Local filesystem links are omitted; the two figures are redrawn from the same recorded values for a dark reading surface. Source and runtime records remain private. This is not a public artifact release or journal peer review. Interface locales include a complete translation of this reading edition; the English text remains the original.

摘要

有限记忆可以改变一个主体此后的行动,但把一次过去的失败存下来,既不构成学习,也不保证信息会被用到。我们检视一套既有的 ORIGIN 实验装置 [apparatus]:两个确定性选择器 [selector] 把不同的既往经历交给同一条固定决策规则。一名居民在已编写的资源约束流域中行动 16 次,结束时储备须至少五单位。两个选择器都只允许两条记录、至多 8192 个规范 UTF-8 字节。归档的 responsive-priority 回合达成义务;其近因对照未达成。两个忽略所选记忆的对照走完全相同的动作/状态序列,也都未达成义务。决定性依赖是显式编写的:近因保留了观测到的障碍线索,但规则在决策 5 的分支只对记住的停滞采集 [stalled collect] 作出响应。因此本报告记录的是有界机制及其校验限度。它不估计总体效应,也不证明大语言模型学习、动机、存活或跨物种等价。我们保留分开的空/负向开发比较,并说明后续经验研究需要什么。

术语

ORIGIN
项目专名,不翻译。
Sol-III
已编写流域世界的专名,不翻译。
延迟义务 [delayed obligation]
只在决策 15 之后计分的要求:终末储备至少为五。此前超过五不算完成。
停滞采集 [stalled collect]
一次采集动作之后储备未见增加(含减少)。这是选择器谓词,并不指明隐蔽原因。源码标识:stalledCollect。
选择器 [selector]
决定居民可见哪些归档记录的策略。此处为 priority 与 recency,各自至多两条记录、8192 个 UTF-8 字节。
实验装置 [apparatus]
已完成并在档的确定性装置:世界、选择器、提供器、校验器与已保存回合。本报告阅读它,并不重跑。
居民 [resident]
流域中的行动主体。不是生物有机体;储备为零并非死亡。
储备 [reserve]
编写世界中的有限资源计数。延迟义务要求终末储备 ≥ 5。

1. 问题与证据

研究问题是:在相同记忆容量下,把居民自己观测到的失败动作经历优先于近因经历,是否改变延迟义务的完成——以及在何种条件下,记住这些经历并不改变行为。目前的回答限于一套已经完成的确定性装置。其用处在于:所选信息、依赖规则的动作、有权威的世界变化与结果,可以分开检视。

该装置在本次研究收件之前已经完成。本报告阅读其源码、已接受记录、七个已保存回合以及派生决策表。它增加源码/记录审计,以及由这些已保存数据绘制的图。它不执行世界、Go 测试或校验器、在线模型或硬件实验。四份外部研究备忘提供了候选问题与来源;其答案不是经验证据。配套的主张/来源表区分原创发现、局部观察、假说与未核实线索。

「失败」需要操作定义。选择器的谓词是:一次 collect 动作之后储备未见增加(含减少)。它不指认隐蔽因果解释,也不断言该动作被拒绝。「延迟」指较早动作影响此后资源可得性的后果,以及只在决策 15 之后才评估的义务。「长期」表示这一有限视界,并不表示无限部署。这些定义跟随已实现的选择器与装置契约。

2. 已完成的装置

既有的 Sol-III current 流域是已编写的无量纲世界。源码规定初始储备 4、effort 1、已存资源 2,以及一处障碍。储备、effort 与存储都有有限上限。居民在 inspect、collect、clear、rest 中选择。clear 改变障碍状态,从而改变此后的雨水捕获。当前知觉暴露储备、effort 与一项观测读数;并不直接暴露每一个世界变量。资源与生命周期声明并不把储备为零变成死亡:居民可以在零继续行动。因此测量终点是期限上的给养,不是存活。这些是 world.go 的源码层描述,不是生物学真实的主张。

每条记忆记录把一名居民实际的动作前知觉、所选动作、以及送达的动作后知觉,绑定到一条回合/运行谱系。只有完整的既前记录才合格。priority 选择器先给观测储备变化非正的 collect 排序,再用近因填满。对照只按近因排序。两者都按时间顺序返回所选记录,跳过过大候选,并把整个所选数组限制为两条记录、8192 字节。选择并不更新模型权重。宿主保留更大的档案与省略证据;面向居民的记忆预算作用于所选暴露,而非计算机总存储。

两条响应臂使用同一个无状态的已编写提供器。其规则有明确时钟:在决策 5(对应含当前在内的剩余十一次决策)只在可见 effort 至少为三且所选记忆含停滞采集时才 clear。中间区间 rest,最后四次决策在 effort 为正时 collect。更早的其他分支响应记忆与当前知觉。因此实验并不要求模型去发现策略。提供器源码使该依赖可检查。

两个 insensitive 对照在当前 effort 为正时 collect,否则 rest,不使用所选记忆。三条字面日程分别检查成功路径、把决策 5 的 clear 换成 rest 的路径、以及全程 rest。延迟目标只在完整、有效的 16 决策回合终末储备至少为五时才满足。此前越过五不足够。

已记录的校验器在计分前重建清单、日志、尝试、请求、所选记忆、动作、观测与终局事实之间的对应。它不依赖提供器;居民本身仍使用已编写的提供器。有效的未达成义务不同于无效或不完整证据。这一区分防止把目标失败悄悄丢成无效记录,也防止把形式完好的轨迹误认为成功结果。

3. 已保存条件中的结果

七个已记录条件各含 16 次决策。其 112 行决策是嵌套测量,不是 112 个独立样本。下列数值读自已保存的运行/校验摘要,并对照相应抽出的终态核对。它们是描述性的固定条件结果,没有基于抽样的区间或 p 值。已保存结果,决策抽出。

条件终末储备终末义务
responsive-priority5达成
responsive-recency0未达成
insensitive-priority0未达成
insensitive-recency0未达成
literal-success-priority5达成
literal-no-clear-priority0未达成
literal-all-rest-priority0未达成
响应式与记忆无关选择器配对在 16 次决策后的储备。可横向滚动查看。

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

图 1. 既有的编写轨迹。响应式配对在清除决策处以及此后的储备上出现差异。无关配对的动作与状态完全相同。要求只在决策 15 处适用;决策 0 时储备为五并不算完成。线段连接已记录的决策状态,并不表示额外观测。

在决策 5,priority 保留经历 [1,4] 并 clear;recency 保留 [3,4] 并 rest。所选记忆数组分别为 2693 与 2692 字节,捕获的 Petition JSON 大小为 5039 与 5038 字节。因此相等的容量上限并不意味着相同的字节数或大语言模型 token 成本。这些是字节,不是分词器测量。源码与已保存选择在此边界确立的是两条记录的瓶颈;并不确立有约束力的 8192 字节瓶颈。

两个响应回合以储备 5 与 0 结束。其字面对照给出相同的储备轨迹;在已编写装置中把 clear 换成 rest 会改变延迟结果。两个无关回合尽管所选记忆不同,却有完全相同的 16 步动作/状态序列。这是针对指定决策规则的对照,不是「记忆不可能起作用」的一般结果。

4. 差异所标识的东西

最强的受支持解释是条件性的:改变选择策略,就改变了供给这条固定响应规则的信息、其决策 5 的动作,以及已保存的下游结果。该依赖被写进规则。结果并不标识一种内在更优的记忆表征,也不标识自发学习。

已保存的近因载体上可见一个关键细节。其决策 5 的所选记忆字节包含经历 3:一次 inspect,其后观测为 reading: 1,即观测到的障碍信号。提供器会从这类后观测计算一个标志,但「剩余十一次决策」分支检查的是 stalledCollect。它并不用该障碍标志在此边界触发 clear。因此,失败的近因臂不能被说成没有任何潜在有用的警告。这是直接的源码/记录观察;另一种策略会利用该线索的命题,是有待检验的说得通的替代解释,不是此处新做的实验。已保存近因载体,响应规则。

无关对照也有一处保留的更正。最初的对照预期停滞采集的有无不同,但两臂都保留了一条。更正后的对照涉及不同的保留经历、相同的世界轨迹。保留原先失败的预期,防止把错误的对照故事改写成阳性结果。已接受的装置记录记下了这段历史。

本集合中没有任何条件通过变动延迟或稀缺来隔离其必要性。报告描述的是在它们在场时运作的机制。它不断言同一选择器对照唯一依赖于其中任一特征,也不断言它在过时失败、改变的前提、不同策略或未考察世界下仍然成立。

5. 校验本身也是证据对象

提供器执行与严格重放共享一条已编写规则。二者一致可以确立一致性,同时错过对已记录契约的共同偏离。一份保留的私有错误变体把最后采集窗口从四次决策缩短为三次;该副本的严格校验接受了该回合,而决策 12 返回的是 inspect 而非独立预期的 collect。原先的产品规则是正确的。策略改动后储备为四,并不是选择器的负向结果。

随后一次附加测试给出十二条字面期望,覆盖决策 11、12、15,正/零 effort,以及空/保留的停滞采集记忆。历史日志记录未改动对照通过,三个可编译的错误变体未通过预定断言。在本次研究收件中,全部八个实现日志哈希与当前测试文件哈希均与记录值相符,并检查了相关失败选择信息。这些是对历史证据的新完整性/阅读核对,不是新执行的测试。接受审计、字面测试、已记录命令与日志。

当前字节核对还把全部 140 个已保存回合文件与七份既有回执对齐,并把全部 95 条归档源码/模块条目与 responsive-priority 清单对齐。这支持所检包的完整性。它不证明原先执行的是哪一个二进制,不确立每一份编译器输入均已归档,也不能代替一次新的独立复现。报告保留已记录的源码发现限度:编译使用要求源码检出位于其构建路径,且构建不加 -trimpath。完整基础设施、崩溃恢复与仓库范围正确性主张仍在本记录之外。

6. 分开的更早开发证据

较旧的论文就绪数据集含八条已编写轨迹、128 个嵌套时刻、四组 adaptive/baseline 剖面比较。其度量是每个 ProcessMoment 之后携带储备在时刻 0–15 上的和,以储备单位·时刻计。adaptive 减 baseline 的差为 +4、0、0 与 −1。它们不是上文的 priority/recency 干预,也不共享其终末端点。定义,四组比较。

四组更早的开发剖面差值:current 为加四,shifted 为零,clustered 为零,sparse 为减一。可横向滚动查看。

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

图 2. 全部四组更早的固定剖面比较,沿用其原来的累积度量。负向与零值均予保留。本图是分开的开发语境,不是对图 1 的追加抽样。

该较旧收件还编目了两次历史本地模型可行性试验、两行装置拓扑。都不能加入七个确定性条件以扩大行为样本。重放、重试、重计分、以及同一轨迹的多行,都保留谱系。较旧的 current、shifted、clustered、sparse 剖面已经检视过,不能靠改名变成盲法留出。

7. 在文献中的位置

记忆系统把应当区分的干预叠在一起。Generative Agents 组合包括基于访问的近因、重要性与相关性在内的检索因子;其访谈消融使用完整架构累积的历史。该评价促使把共同历史的决策探针与完整轨迹干预分开。它并不验证本流域结果。Park et al., 2023, §§4.1 and 6.1–6.2。

Reflexion 通过文本反馈改变此后语境,而不改变基座模型权重。其 WebShop 附录也报告了一种试图的改进并未实现的设置。机制与该限度都反对把记忆或反思当成无条件收益。它们涉及与本装置不同的任务与试验结构。Shinn et al., 2023, abstract and Appendix B.1。

对后续经验研究,样本量必须跟随推断目标与有根据的假定。例如基于精度的规划需要目标区间宽度与变异说明;没有任何论文给出 ORIGIN 运行次数的普遍充足数。Lakens, 2022, “Planning for Precision”。

在 ACM 的产物术语中,产物可用性/功能性与独立获得的结果是分开的成就。本报告提供局部完整性审计与可复现的图推导;并不主张评审徽章或独立实验复现。ACM SIGIR artifact criteria。

LongMemEval 用神谕检索到的证据评估阅读策略,表明即使证据会话已被供给,阅读器设计仍影响问答表现。这在聊天历史问答任务内加强了检索与使用的区分。它不测量持久世界中的行动。Wu et al., v2, §5.5。

XENON 把经历记忆接到依赖校正与候选动作校正。因此它是另一种干预的参照,不同于在保持本装置选择器固定时改变回合暴露。Lee et al., v3, §§4.1–4.2。

Vending-Bench 把近语境限度与无显式存储约束的外部记忆工具分开。其原先的 GPT-4o-mini 语境容量消融报告更大限度下更差的结果。这告诫不要把每一记忆层当成同一预算,也不要假定单调收益;其商业域与历史模型不是 ORIGIN 结果。Backlund and Petersson, v1, §§2.1 and 3.5.2。

Agarwal 及同事的少次运行强化学习分析涉及随机训练/评估运行之间的变异。其统计建议需要适当的抽样结构,并不为这七个已编写条件提供置信区间。Agarwal et al., NeurIPS 2021。

人类/非人类与计算/量子发现仍是分开的组合输入,不是本结果的证据。源码裁定记录了承认的范围,以及对过窄或不完整收集摘要的更正。

8. 可证伪的后续

下一个经验问题可以问:对已声明的模型/任务分布,选择器对照是否改变完整回合的目标概率。方向必须保持开放。有用的阴性结果是:保留相关失败记录却不改善所选动作或终末结果;有害结果同样有信息。当前的源码检视还促使把保留与决策规则的线索使用契约区分开。

在任何收集之前,界定合格观测、可访问存储与每次决策暴露、选择器/平局/溢出规则、送达提示、模型及请求/报告版本、资源限度、世界/初态分布、受保护留出、期限、独立计分期望、失败/重试谱系、停止规则与主分析。在报告实际消耗的同时匹配允许的资源上限。不要强迫干预后的世界/观测轨迹保持相等;那些差异可能携带所研究的效应。

以完整回合为单元,并声明任务块或配对。有互动居民的共享世界需要群体/世界单元。在看结果之前,陈述所有已启动回合的分母以及对不可得结果的处理。共同种子并不能保证轨迹分叉后模型随机性仍对应。选择有意义的效应或精度目标,并在可辩护假定下评估样本量敏感性;这些量此处尚未设定。这是一项拟议研究,不是预注册,也不是已完成的经验结果。

9. 复现与可用性

底层源码与运行记录仍为私有。本阅读版保留经内部审阅草稿的科学主张与记录数值。文中的本地源码与审计指称点名该私有包中的记录;它们不是公开产物链接。

两幅 SVG 图按本站接受的抽出与比较值重绘。图中数值可供核对应绘点。重建一幅图不同于重放世界。这些派生值不能代替底层源码、回合记录与独立计分器。

公开研究发布仍需要可问责的署名、冻结的源码/数据与脱敏包、稳定的产物链接,以及对发布包的审查。此处尚未指派或发布这些。已完成的内部审阅覆盖技术稿及其图;它不是期刊同行评审,也不是独立的装置执行。更正仍是研究记录的一部分。

修订记录

2026 年 9 月 9 日。经内部审阅的技术草稿的网站阅读版。科学主张与记录数值予以保留。省略本地文件系统链接;两幅图按同一记录值重绘,适配深色阅读面。源码与运行记录仍为私有。这不是公开产物发布,也不是期刊同行评审。界面语言含本阅读版的全文翻译;英文文本仍为原稿。

摘要

有限記憶可以改變一個主體此後的行動,但把一次過去的失敗存下來,既不構成學習,也不保證資訊會被用到。我們檢視一套既有的 ORIGIN 實驗裝置 [apparatus]:兩個確定性選擇器 [selector] 把不同的既往經歷交給同一條固定決策規則。一名居民在已編寫的資源約束流域中行動 16 次,結束時儲備須至少五單位。兩個選擇器都只允許兩條記錄、至多 8192 個規範 UTF-8 位元組。歸檔的 responsive-priority 回合達成義務;其近因對照未達成。兩個忽略所選記憶的對照走完全相同的動作/狀態序列,也都未達成義務。決定性依賴是顯式編寫的:近因保留了觀測到的障礙線索,但規則在決策 5 的分支只對記住的停滯採集 [stalled collect] 作出響應。因此本報告記錄的是有界機制及其校驗限度。它不估計總體效應,也不證明大型語言模型學習、動機、存活或跨物種等價。我們保留分開的空/負向開發比較,並說明後續經驗研究需要什麼。

術語

ORIGIN
專案專名,不翻譯。
Sol-III
已編寫流域世界的專名,不翻譯。
延遲義務 [delayed obligation]
只在決策 15 之後計分的要求:終末儲備至少為五。此前超過五不算完成。
停滯採集 [stalled collect]
一次採集動作之後儲備未見增加(含減少)。這是選擇器謂詞,並不指明隱蔽原因。原始碼標識:stalledCollect。
選擇器 [selector]
決定居民可見哪些歸檔記錄的策略。此處為 priority 與 recency,各自至多兩條記錄、8192 個 UTF-8 位元組。
實驗裝置 [apparatus]
已完成並在檔的確定性裝置:世界、選擇器、提供器、校驗器與已保存回合。本報告閱讀它,並不重跑。
居民 [resident]
流域中的行動主體。不是生物有機體;儲備為零並非死亡。
儲備 [reserve]
編寫世界中的有限資源計數。延遲義務要求終末儲備 ≥ 5。

1. 問題與證據

研究問題是:在相同記憶容量下,把居民自己觀測到的失敗動作經歷優先於近因經歷,是否改變延遲義務的完成——以及在何種條件下,記住這些經歷並不改變行為。目前的回答限於一套已經完成的確定性裝置。其用處在於:所選資訊、依賴規則的動作、有權威的世界變化與結果,可以分開檢視。

該裝置在本次研究收件之前已經完成。本報告閱讀其原始碼、已接受記錄、七個已保存回合以及派生決策表。它增加原始碼/記錄審計,以及由這些已保存資料繪製的圖。它不執行世界、Go 測試或校驗器、線上模型或硬體實驗。四份外部研究備忘提供了候選問題與來源;其答案不是經驗證據。配套的主張/來源表區分原創發現、局部觀察、假說與未核實線索。

「失敗」需要操作定義。選擇器的謂詞是:一次 collect 動作之後儲備未見增加(含減少)。它不指認隱蔽因果解釋,也不斷言該動作被拒絕。「延遲」指較早動作影響此後資源可得性的後果,以及只在決策 15 之後才評估的義務。「長期」表示這一有限視界,並不表示無限部署。這些定義跟隨已實現的選擇器與裝置契約。

2. 已完成的裝置

既有的 Sol-III current 流域是已編寫的無量綱世界。原始碼規定初始儲備 4、effort 1、已存資源 2,以及一處障礙。儲備、effort 與存儲都有有限上限。居民在 inspect、collect、clear、rest 中選擇。clear 改變障礙狀態,從而改變此後的雨水捕獲。當前知覺暴露儲備、effort 與一項觀測讀數;並不直接暴露每一個世界變數。資源與生命週期聲明並不把儲備為零變成死亡:居民可以在零繼續行動。因此測量終點是期限上的給養,不是存活。這些是 world.go 的原始碼層描述,不是生物學真實的主張。

每條記憶記錄把一名居民實際的動作前知覺、所選動作、以及送達的動作後知覺,綁定到一條回合/運行譜系。只有完整的既前記錄才合格。priority 選擇器先給觀測儲備變化非正的 collect 排序,再用近因填滿。對照只按近因排序。兩者都按時間順序返回所選記錄,跳過過大候選,並把整個所選陣列限制為兩條記錄、8192 位元組。選擇並不更新模型權重。宿主保留更大的檔案與省略證據;面向居民的記憶預算作用於所選暴露,而非電腦總存儲。

兩條響應臂使用同一個無狀態的已編寫提供器。其規則有明確時鐘:在決策 5(對應含當前在內的剩餘十一次決策)只在可見 effort 至少為三且所選記憶含停滯採集時才 clear。中間區間 rest,最後四次決策在 effort 為正時 collect。更早的其他分支響應記憶與當前知覺。因此實驗並不要求模型去發現策略。提供器原始碼使該依賴可檢查。

兩個 insensitive 對照在當前 effort 為正時 collect,否則 rest,不使用所選記憶。三條字面日程分別檢查成功路徑、把決策 5 的 clear 換成 rest 的路徑、以及全程 rest。延遲目標只在完整、有效的 16 決策回合終末儲備至少為五時才滿足。此前越過五不足夠。

已記錄的校驗器在計分前重建清單、日誌、嘗試、請求、所選記憶、動作、觀測與終局事實之間的對應。它不依賴提供器;居民本身仍使用已編寫的提供器。有效的未達成義務不同於無效或不完整證據。這一區分防止把目標失敗悄悄丟成無效記錄,也防止把形式完好的軌跡誤認為成功結果。

3. 已保存條件中的結果

七個已記錄條件各含 16 次決策。其 112 行決策是嵌套測量,不是 112 個獨立樣本。下列數值讀自己保存的運行/校驗摘要,並對照相應抽出的終態核對。它們是描述性的固定條件結果,沒有基於抽樣的區間或 p 值。已保存結果,決策抽出。

條件終末儲備終末義務
responsive-priority5達成
responsive-recency0未達成
insensitive-priority0未達成
insensitive-recency0未達成
literal-success-priority5達成
literal-no-clear-priority0未達成
literal-all-rest-priority0未達成
響應式與記憶無關選擇器配對在 16 次決策後的儲備。可橫向捲動檢視。

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

圖 1. 既有的編寫軌跡。響應式配對在清除決策處以及此後的儲備上出現差異。無關配對的動作與狀態完全相同。要求只在決策 15 處適用;決策 0 時儲備為五並不算完成。線段連接已記錄的決策狀態,並不表示額外觀測。

在決策 5,priority 保留經歷 [1,4] 並 clear;recency 保留 [3,4] 並 rest。所選記憶陣列分別為 2693 與 2692 位元組,捕獲的 Petition JSON 大小為 5039 與 5038 位元組。因此相等的容量上限並不意味著相同的位元組數或大型語言模型 token 成本。這些是位元組,不是分詞器測量。原始碼與已保存選擇在此邊界確立的是兩條記錄的瓶頸;並不確立有約束力的 8192 位元組瓶頸。

兩個響應回合以儲備 5 與 0 結束。其字面對照給出相同的儲備軌跡;在已編寫裝置中把 clear 換成 rest 會改變延遲結果。兩個無關回合儘管所選記憶不同,卻有完全相同的 16 步動作/狀態序列。這是針對指定決策規則的對照,不是「記憶不可能起作用」的一般結果。

4. 差異所標識的東西

最強的受支援解釋是條件性的:改變選擇策略,就改變了供給這條固定響應規則的資訊、其決策 5 的動作,以及已保存的下游結果。該依賴被寫進規則。結果並不標識一種內在更優的記憶表徵,也不標識自發學習。

已保存的近因載體上可見一個關鍵細節。其決策 5 的所選記憶位元組包含經歷 3:一次 inspect,其後觀測為 reading: 1,即觀測到的障礙信號。提供器會從這類後觀測計算一個標誌,但「剩餘十一次決策」分支檢查的是 stalledCollect。它並不用該障礙標誌在此邊界觸發 clear。因此,失敗的近因臂不能被說成沒有任何潛在有用的警告。這是直接的原始碼/記錄觀察;另一種策略會利用該線索的命題,是有待檢驗的說得通的替代解釋,不是此處新做的實驗。已保存近因載體,響應規則。

無關對照也有一處保留的更正。最初的對照預期停滯採集的有無不同,但兩臂都保留了一條。更正後的對照涉及不同的保留經歷、相同的世界軌跡。保留原先失敗的預期,防止把錯誤的對照故事改寫成陽性結果。已接受的裝置記錄記下了這段歷史。

本集合中沒有任何條件通過變動延遲或稀缺來隔離其必要性。報告描述的是在它們在場時運作的機制。它不斷言同一選擇器對照唯一依賴於其中任一特徵,也不斷言它在過時失敗、改變的前提、不同策略或未考察世界下仍然成立。

5. 校驗本身也是證據對象

提供器執行與嚴格重放共享一條已編寫規則。二者一致可以確立一致性,同時錯過對已記錄契約的共同偏離。一份保留的私有錯誤變體把最後採集窗口從四次決策縮短為三次;該副本的嚴格校驗接受了該回合,而決策 12 返回的是 inspect 而非獨立預期的 collect。原先的產品規則是正確的。策略改動後儲備為四,並不是選擇器的負向結果。

隨後一次附加測試給出十二條字面期望,覆蓋決策 11、12、15,正/零 effort,以及空/保留的停滯採集記憶。歷史日誌記錄未改動對照通過,三個可編譯的錯誤變體未通過預定斷言。在本次研究收件中,全部八個實現日誌雜湊與當前測試檔案雜湊均與記錄值相符,並檢查了相關失敗選擇資訊。這些是對歷史證據的新完整性/閱讀核對,不是新執行的測試。接受審計、字面測試、已記錄命令與日誌。

當前位元組核對還把全部 140 個已保存回合檔案與七份既有回執對齊,並把全部 95 條歸檔原始碼/模組條目與 responsive-priority 清單對齊。這支援所檢包的完整性。它不證明原先執行的是哪一個二進位,不確立每一份編譯器輸入均已歸檔,也不能代替一次新的獨立復現。報告保留已記錄的原始碼發現限度:編譯使用要求原始碼檢出位於其建置路徑,且建置不加 -trimpath。完整基礎設施、崩潰恢復與倉庫範圍正確性主張仍在本記錄之外。

6. 分開的更早開發證據

較舊的論文就緒資料集含八條已編寫軌跡、128 個嵌套時刻、四組 adaptive/baseline 剖面比較。其度量是每個 ProcessMoment 之後攜帶儲備在時刻 0–15 上的和,以儲備單位·時刻計。adaptive 減 baseline 的差為 +4、0、0 與 −1。它們不是上文的 priority/recency 干預,也不共享其終末端點。定義,四組比較。

四組更早的開發剖面差值:current 為加四,shifted 為零,clustered 為零,sparse 為減一。可橫向捲動檢視。

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

圖 2. 全部四組更早的固定剖面比較,沿用其原來的累積度量。負向與零值均予保留。本圖是分開的開發語境,不是對圖 1 的追加抽樣。

該較舊收件還編目了兩次歷史本地模型可行性試驗、兩行裝置拓撲。都不能加入七個確定性條件以擴大行為樣本。重放、重試、重計分、以及同一軌跡的多行,都保留譜系。較舊的 current、shifted、clustered、sparse 剖面已經檢視過,不能靠改名變成盲法留出。

7. 在文獻中的位置

記憶系統把應當區分的干預疊在一起。Generative Agents 組合包括基於訪問的近因、重要性與相關性在內的檢索因子;其訪談消融使用完整架構累積的歷史。該評價促使把共同歷史的決策探針與完整軌跡干預分開。它並不驗證本流域結果。Park et al., 2023, §§4.1 and 6.1–6.2。

Reflexion 通過文本反饋改變此後語境,而不改變基座模型權重。其 WebShop 附錄也報告了一種試圖的改進並未實現的設置。機制與該限度都反對把記憶或反思當成無條件收益。它們涉及與本裝置不同的任務與試驗結構。Shinn et al., 2023, abstract and Appendix B.1。

對後續經驗研究,樣本量必須跟隨推斷目標與有根據的假定。例如基於精度的規劃需要目標區間寬度與變異說明;沒有任何論文給出 ORIGIN 運行次數的普遍充足數。Lakens, 2022, “Planning for Precision”。

在 ACM 的產物術語中,產物可用性/功能性與獨立獲得的結果是分開的成就。本報告提供局部完整性審計與可復現的圖推導;並不主張評審徽章或獨立實驗復現。ACM SIGIR artifact criteria。

LongMemEval 用神諭檢索到的證據評估閱讀策略,表明即使證據會話已被供給,閱讀器設計仍影響問答表現。這在聊天歷史問答任務內加強了檢索與使用的區分。它不測量持久世界中的行動。Wu et al., v2, §5.5。

XENON 把經歷記憶接到依賴校正與候選動作校正。因此它是另一種干預的參照,不同於在保持本裝置選擇器固定時改變回合暴露。Lee et al., v3, §§4.1–4.2。

Vending-Bench 把近語境限度與無顯式存儲約束的外部記憶工具分開。其原先的 GPT-4o-mini 語境容量消融報告更大限度下更差的結果。這告誡不要把每一記憶層當成同一預算,也不要假定單調收益;其商業域與歷史模型不是 ORIGIN 結果。Backlund and Petersson, v1, §§2.1 and 3.5.2。

Agarwal 及同事的少次運行強化學習分析涉及隨機訓練/評估運行之間的變異。其統計建議需要適當的抽樣結構,並不為這七個已編寫條件提供信賴區間。Agarwal et al., NeurIPS 2021。

人類/非人類與計算/量子發現仍是分開的組合輸入,不是本結果的證據。原始碼裁定記錄了承認的範圍,以及對過窄或不完整收集摘要的更正。

8. 可證偽的後續

下一個經驗問題可以問:對已聲明的模型/任務分布,選擇器對照是否改變完整回合的目標概率。方向必須保持開放。有用的陰性結果是:保留相關失敗記錄卻不改善所選動作或終末結果;有害結果同樣有資訊。當前的原始碼檢視還促使把保留與決策規則的線索使用契約區分開。

在任何收集之前,界定合格觀測、可訪問存儲與每次決策暴露、選擇器/平局/溢出規則、送達提示、模型及請求/報告版本、資源限度、世界/初態分布、受保護留出、期限、獨立計分期望、失敗/重試譜系、停止規則與主分析。在報告實際消耗的同時匹配允許的資源上限。不要強迫干預後的世界/觀測軌跡保持相等;那些差異可能攜帶所研究的效應。

以完整回合為單元,並聲明任務塊或配對。有互動居民的共享世界需要群體/世界單元。在看結果之前,陳述所有已啟動回合的分母以及對不可得結果的處理。共同種子並不能保證軌跡分叉後模型隨機性仍對應。選擇有意義的效應或精度目標,並在可辯護假定下評估樣本量敏感性;這些量此處尚未設定。這是一項擬議研究,不是預註冊,也不是已完成的經驗結果。

9. 復現與可用性

底層原始碼與運行記錄仍為私有。本閱讀版保留經內部審閱草稿的科學主張與記錄數值。文中的本地原始碼與審計指稱點名該私有包中的記錄;它們不是公開產物連結。

兩幅 SVG 圖按本站接受的抽出與比較值重繪。圖中數值可供核對應繪點。重建一幅圖不同於重放世界。這些派生值不能代替底層原始碼、回合記錄與獨立計分器。

公開研究發布仍需要可問責的署名、凍結的原始碼/資料與脫敏包、穩定的產物連結,以及對發布包的審查。此處尚未指派或發布這些。已完成的內部審閱覆蓋技術稿及其圖;它不是期刊同行評審,也不是獨立的裝置執行。更正仍是研究記錄的一部分。

修訂紀錄

2026 年 9 月 9 日。經內部審閱的技術草稿的網站閱讀版。科學主張與記錄數值予以保留。省略本地檔案系統連結;兩幅圖按同一記錄值重繪,適配深色閱讀面。原始碼與運行記錄仍為私有。這不是公開產物發布,也不是期刊同行評審。介面語言含本閱讀版的全文翻譯;英文文本仍為原稿。

要旨

有限の記憶は主体の将来の行為を変えうるが、過去の失敗を保存しただけでは学習が成立せず、その情報が使われる保証もない。既存の ORIGIN 実験装置 [apparatus] を読む。二つの確定的選択器 [selector] が、固定の決定規則に異なる過去経験を見せる。一人の住民が、作成済みの資源制約集水域で16回行為し、終了時に備蓄を少なくとも5単位残さねばならない。両選択器とも記録は2件、正規UTF-8は最大8192バイト。保存された responsive-priority のエピソードは義務に達し、近因側は達しない。選ばれた記憶を無視する二つの対照は同一の行為/状態系列をたどり、どちらも義務を外す。決定的な依存は明示的に書かれている。近因は観測された障害の手がかりを保持するが、規則の決定5の分岐は記憶された停滞収集 [stalled collect] にだけ応答する。本報告は有界な機構とその検証の限界を記録する。母集団効果を推定せず、LLM学習・動機・生存・種間同等も示さない。別個の帰無/逆方向の開発比較を残し、後続の経験的研究に必要なものを指定する。

用語

ORIGIN
プロジェクト固有名。訳さない。
Sol-III
作成済み集水域世界の固有名。訳さない。
遅延義務 [delayed obligation]
決定15の後にのみ採点される要件。終端備蓄が5以上。それ以前に5を超えても完了ではない。
停滞収集 [stalled collect]
収集の後に備蓄の可視な増加がないこと(減少を含む)。選択器の述語であり、隠れた原因を名指ししない。ソース識別子は stalledCollect。
選択器 [selector]
住民が見られるアーカイブ記録を選ぶ方針。ここでは priority 対 recency。いずれも記録2件・8192 UTF-8バイトが上限。
実験装置 [apparatus]
記録済みの確定的装置。世界、選択器、プロバイダ、検証器、保存エピソード。本報告はそれを読むのであり、再実行しない。
住民 [resident]
集水域で行為する主体。生物ではなく、備蓄ゼロは死ではない。
備蓄 [reserve]
作成世界の有限資源カウンタ。遅延義務は終端備蓄 ≥ 5 を要求する。

1. 問いと証拠

研究上の問いは、同一の記憶容量で、住民自身が観測した失敗行為の経験を最近の経験より優先することが、遅延義務の完了を変えるか——そして、それらの経験を覚えていても行為が変わらないのはどの条件か——である。現在の答えは、すでに完了した確定的装置に限る。選ばれた情報、規則依存の行為、権威ある世界変化、結果を分けて調べられる点が有用である。

装置は本調査の受領より前に完了している。本報告はそのソース、受理記録、保存エピソード7件、派生決定表を読む。ソース/記録の監査と、それらの保存データから得た図を加える。世界、Goテストや検証器、生のモデル、ハードウェア実験は実行しない。外部研究メモ4件が候補の問いと出典を供給したが、その答えは経験的証拠ではない。付属の主張/出典表は、原著の所見、局所観察、仮説、未検証の手がかりを区別する。

「失敗」には操作的定義が要る。選択器の述語は、collect の後に備蓄の可視な増加がないこと(減少を含む)。隠れた因果説明を特定せず、行為が拒否されたとも主張しない。「遅延」は、後の資源可用性に効く以前の行為の帰結と、決定15の後にのみ評価される義務を指す。「長期」はこの有限地平であり、無期限の配備ではない。これらの定義は実装された選択器と装置契約に従う。

2. 完了した装置

既存の Sol-III current 集水域は、作成済みの無次元世界である。ソースは初期備蓄4、effort 1、貯蔵資源2、障害を定める。備蓄、effort、貯蔵には有限上限がある。住民は inspect、collect、clear、rest から選ぶ。clear は障害状態を変え、後の雨水捕捉を変える。現在の知覚は備蓄、effort、観測読みを見せ、すべての世界変数を直接は見せない。資源とライフサイクルの宣言は備蓄ゼロを死にしない。住民はゼロでも行為を続けられる。測定端点は期限での補給であり、生存ではない。これらは world.go のソース水準の記述であり、生物学的実在の主張ではない。

各記憶記録は、ある住民の実際の行為前知覚、選んだ行為、届けられた行為後知覚を、エピソード/実行の系譜に結びつける。完全な先行記録だけが適格である。priority 選択器は、観測された備蓄変化が非正の collect を先に順位づけ、残りを近因で埋める。比較器は近因のみで順位づける。どちらも選ばれた記録を時系列で返し、過大な候補を飛ばし、選択配列全体を記録2件・8192バイトに抑える。選択はモデル重みを更新しない。ホストはより大きいアーカイブと省略の証拠を保持する。住民向け記憶予算は選択された露出に適用され、計算機の総記憶ではない。

応答側の両腕は、同じ状態なしの作成済みプロバイダを使う。規則には明示の時計がある。決定5(現在を含む残り11決定)では、可視 effort が3以上で、選択記憶に停滞収集があるときに限り clear する。中間区間は rest し、最後の4決定では正の effort で collect する。より早い他の分岐は記憶と現在知覚に応答する。よって実験はモデルに戦略の発見を求めない。プロバイダのソースが依存を検査可能にする。

二つの insensitive 対照は、現在の effort が正なら collect、さもなくば rest し、選択記憶を使わない。三つの字面スケジュールは、成功経路、決定5の clear を rest に置き換えた経路、すべて rest を調べる。遅延目標は、完全で有効な16決定エピソードの終端備蓄が5以上のときにだけ満たされる。それ以前に5を超えても足りない。

記録された検証器は、採点前にマニフェスト、日誌、試行、要求、選択記憶、行為、観測、終局事実の対応を再構成する。プロバイダ非依存である。住民自身はなお作成済みプロバイダを使う。有効な未達義務は、無効または不完全な証拠とは別である。この区別は、目標失敗を無効記録として黙って捨てることと、整形式の軌跡を成功結果と取り違えることを防ぐ。

3. 保存条件における結果

記録された七条件は各16決定を含む。112行の決定は入れ子の測定であり、112の独立標本ではない。次の値は保存された実行/検証要約から読み、対応する抽出終状態と照合した。標本に基づく区間も p 値もない、記述的な固定条件の結果である。保存結果、決定抽出。

条件終端の備蓄終端の義務
responsive-priority5達成
responsive-recency0未達
insensitive-priority0未達
insensitive-recency0未達
literal-success-priority5達成
literal-no-clear-priority0未達
literal-all-rest-priority0未達
応答型および記憶非依存の選択器ペアについて、16回の決定ごとの備蓄。横スクロールで確認できる。

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

図1. 既存の作成済み軌跡。応答型ペアは除去の決定とその後の備蓄で異なる。非依存ペアの行為と状態は同一である。要件は決定15にのみ適用され、決定0で備蓄が5でも完了ではない。線は記録された決定状態を結び、追加の観測を意味しない。

決定5で priority は経験 [1,4] を保持して clear し、recency は [3,4] を保持して rest する。選択記憶配列はそれぞれ2693と2692バイト、捕捉した Petition JSON は5039と5038バイト。等しい容量上限は、同一のバイト数や LLM トークン費用を意味しない。これはバイトであり、トークナイザ測定ではない。ソースと保存された選択は、この境界で記録2件の隘路を確立する。拘束力ある8192バイトの隘路は確立しない。

二つの応答エピソードは備蓄5と0で終わる。字面の対は同じ備蓄軌跡を与える。作成済み装置で clear を rest に替えると遅延結果が変わる。二つの非依存エピソードは、選択記憶が違うのに16段の行為/状態系列が同一である。これは指定の決定規則に対する対照であり、記憶が効きえないという一般結果ではない。

4. 差が識別するもの

最も強く支えられる解釈は条件付きである。選択方針を変えると、この固定応答規則に供給される情報、決定5の行為、保存された下流結果が変わる。依存は規則に設計されている。結果は、本質的に優れた記憶表現や自発学習を識別しない。

保存された近因キャリアに重要な細部が見える。決定5の選択記憶バイトは経験3を含む。inspect で、事後観測は reading: 1、観測された障害信号である。プロバイダはその種の事後観測から旗を計算するが、残り11決定の分岐は代わりに stalledCollect を見る。この境界でその障害旗を clear の引き金には使わない。よって敗れた近因腕を、潜在的に有用な警告がなかったとは言えない。これは直接のソース/記録観察である。別方針がその手がかりを使うという命題は、ここで新たに行った実験ではなく、検証すべき尤もな代替説明である。保存近因キャリア、応答規則。

非依存比較にも保持された訂正がある。当初の対照は停滞収集の有無の差を期待したが、両腕とも1件を保持した。訂正後の対照は、同一の世界軌跡で保持経験が異なることだった。当初の失敗した期待を残すことで、誤った対照物語が陽性結果に変換されるのを防ぐ。受理された装置記録がその経緯を残す。

本集合のどの条件も、遅延や希少を動かしてその必要性を単離しない。報告は、それらがある状態で働く機構を記述する。同じ選択器対比がいずれかの特徴に一意に依存するとも、古い失敗、変わった前提、別方針、未検討の世界で持続するとも主張しない。

5. 検証そのものが証拠の対象である

プロバイダ実行と厳密再生は作成済み規則を共有する。一致は一貫性を示しつつ、文書化された契約からの共有逸脱を見逃しうる。保存された私的な誤変種は最終収集窓を4決定から3に短くした。その写しの厳密検証はエピソードを受理したが、決定12は独立に期待される collect ではなく inspect を返した。元の製品規則は正しかった。方針変更後の備蓄4は、選択器の逆結果ではない。

加法テストは、決定11・12・15、正/ゼロ effort、空/保持の停滞収集記憶にわたる12の字面期待を与えた。歴史ログは、未改変対照の合格と、意図した断言に落ちるコンパイル可能な誤変種3件を記録する。本調査の受領では、実装ログハッシュ8件すべてと現在のテストファイルハッシュが記録値と一致し、関連する失敗選択メッセージを検査した。これは歴史証拠の新たな完全性/読取点検であり、新たに実行したテストではない。受理監査、字面テスト、記録コマンドとログ。

現在のバイト点検は、保存エピソードファイル140件すべてを既存の受領7件と、アーカイブされたソース/モジュール項目95件すべてを responsive-priority マニフェストと照合した。検査した包の完全性を支える。どのバイナリが元来実行されたかを証明せず、すべてのコンパイラ入力がアーカイブされたとも確立せず、新たな独立再現の代わりにもならない。報告は文書化されたソース発見の限界を残す。コンパイル使用には、ビルド経路でのソースチェックアウトと -trimpath なしのビルドが要る。完全な基盤、クラッシュ回復、リポジトリ全体の正しさの主張はこの記録の外である。

6. 別個の以前の開発証拠

より古い論文準備データセットは、作成軌跡8、入れ子時刻128、adaptive/baseline プロファイル比較4を含む。指標は各 ProcessMoment 後の携帯備蓄を時刻0–15で合計したもので、備蓄単位・時刻で測る。adaptive から baseline を引いた差は +4、0、0、−1。上記の priority/recency 介入ではなく、終端も共有しない。定義、4比較。

以前の開発プロファイル差4件:current は+4、shifted は0、clustered は0、sparse は−1。横スクロールで確認できる。

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

図2. 以前の固定プロファイル比較4件すべて。元の累積指標を用いる。負値とゼロは保持する。本図は別個の開発文脈であり、図1への追加標本ではない。

その古い受領には、歴史的な局所モデルの実現可能性試験2件と装置トポロジ行2も目録される。どれも七つの確定条件に足して行動標本を広げられない。再生、再試行、再採点、同一軌跡の複数行は系譜を保持する。古い current、shifted、clustered、sparse プロファイルはすでに検査済みで、改名しても盲検ホールドアウトにはならない。

7. 文献上の位置

記憶システムは区別すべき介入を組み合わせる。Generative Agents はアクセス近因・重要度・関連を含む検索因子を組み合わせ、面接アブレーションは全アーキテクチャが蓄積した履歴を使う。その評価は、共通履歴の決定プローブと完全軌跡介入を分ける動機になる。本集水域の結果を検証しない。Park et al., 2023, §§4.1 and 6.1–6.2。

Reflexion は基底モデル重みを変えず、テキストフィードバックで後続文脈を変える。WebShop 付録は、試みられた改善が現れなかった設定も報告する。機構とその限界の双方が、記憶や内省を無条件の便益と扱うことに反対する。本装置とは異なる課題と試行構造である。Shinn et al., 2023, abstract and Appendix B.1。

後続の経験研究では、標本サイズは推論目標と正当化された仮定に従う必要がある。精度計画は例えば目標区間幅と変動の説明を要する。ORIGIN 実行の普遍的に十分な数を与える論文はない。Lakens, 2022, “Planning for Precision”。

ACM の成果物用語では、成果物の利用可能性/機能と独立に得た結果は別の達成である。本報告は局所完全性監査と再現可能な図の導出を提供する。審査バッジや独立実験再現は主張しない。ACM SIGIR artifact criteria。

LongMemEval は神託検索の証拠で読解方針を評価し、証拠セッションが与えられても読者設計が QA 性能に効くことを示す。チャット履歴 QA 課題の中で、検索と使用の区別を強める。持続世界の行為は測らない。Wu et al., v2, §5.5。

XENON は経験記憶を依存訂正と候補行為訂正に結合する。よって本装置の選択器を固定したままエピソード露出を変えるのとは別の介入の参照である。Lee et al., v3, §§4.1–4.2。

Vending-Bench は最近文脈の限界を、明示の記憶制約のない外部記憶ツールから分ける。元の GPT-4o-mini 文脈容量アブレーションは、より大きい限界でより悪い結果を報告する。あらゆる記憶層を一つの予算と扱うこと、単調な便益を仮定することへの戒めである。その業務領域と歴史モデルは ORIGIN の結果ではない。Backlund and Petersson, v1, §§2.1 and 3.5.2。

Agarwal らの少数実行強化学習分析は、確率的訓練/評価実行間の変動に関する。統計上の勧告は適切な標本構造を要し、これら七つの作成条件に信頼区間を与えない。Agarwal et al., NeurIPS 2021。

ヒト/非ヒトおよび計算/量子の所見は別個のポートフォリオ入力であり、本結果の証拠ではない。ソース裁定は認められた範囲と、過狭または不完全な収集要約への訂正を記録する。

8. 反証可能な継続

次の経験的問いは、宣言されたモデル/課題分布について、選択器対比が完全エピソードの目標確率を変えるか、でありうる。方向は開いたままにする。有用な陰性結果は、関連する失敗記録を保持しつつ選んだ行為も終端結果も改善しないことである。有害な結果も情報になる。現在のソース検査はさらに、保持と決定規則の手がかり使用契約を分ける動機になる。

収集の前に、適格観測、アクセス可能な記憶と決定ごとの露出、選択器/同着/オーバーフロー規則、届けられるプロンプト、モデルと要求/報告版、資源限界、世界/初期状態分布、保護ホールドアウト、期限、独立採点期待、失敗/再試行系譜、停止規則、主解析を定める。許された資源天井に合わせつつ実際消費を報告する。介入後の世界/観測軌跡を等しく保つことを強制しない。その差が研究対象の効果を運びうる。

完全エピソードを単位とし、課題ブロックや対を宣言する。相互作用する住民の共有世界は集団/世界単位を要する。結果を見る前に、起動した全エピソードの分母と、得られない結果の扱いを述べる。共通シードは、軌跡が分岐した後のモデル乱数の対応を保証しない。意味ある効果または精度目標を選び、擁護可能な仮定の下で標本サイズ感度を評価する。これらの量はここでは未設定である。これは提案研究であり、事前登録でも完了した経験結果でもない。

9. 再現と利用可能性

下層ソースと実行記録は私有のままである。本読書版は内部審査済み草稿の科学的主張と記録値を保つ。本文中の局所ソースと監査参照は、その私有包の記録を名指しする。公開成果物リンクではない。

二つの SVG 図は、本サイト向けに受理された抽出・比較値から描き直した。図の値で描点を検査できる。図の再構築は世界の再生とは違う。これらの派生値は下層ソース、エピソード記録、独立採点器の代わりにならない。

公開研究リリースにはなお、責任ある著者表示、凍結したソース/データと墨消し束、安定した成果物リンク、そのリリース包の審査が要る。ここでは割り当てられても公開されてもいない。完了した内部審査は技術原稿とその図を覆う。雑誌査読でも独立した装置実行でもない。訂正は研究記録の一部のままである。

改訂履歴

2026年9月9日。内部審査済み技術草稿のウェブサイト読書版。科学的主張と記録値は保持する。局所ファイルシステムリンクは省き、二つの図は同一の記録値から暗い読書面向けに描き直す。ソースと実行記録は私有のまま。公開成果物リリースでも雑誌査読でもない。インターフェースロケールは本読書版の完訳を含む。英語本文が原文である。

초록

유한한 기억은 주체의 이후 행동을 바꿀 수 있지만, 과거의 실패를 저장했다고 해서 학습이 성립하거나 그 정보가 쓰이리라는 보장은 없다. 기존의 ORIGIN 실험 장치 [apparatus]를 검토한다. 두 결정론적 선택기 [selector]가 고정된 결정 규칙에 서로 다른 과거 경험을 보여 준다. 한 거주자가 작성된 자원 제약 집수에서 16번 행동하며, 끝날 때 비축이 적어도 다섯 단위여야 한다. 두 선택기 모두 기록 2건, 정규 UTF-8 최대 8192바이트다. 보관된 responsive-priority 에피소드는 의무에 도달하고, 그 최근성 대조는 도달하지 않는다. 선택된 기억을 무시하는 두 통제는 동일한 행동/상태 수열을 따르며 둘 다 의무를 놓친다. 결정적 의존은 명시적으로 작성되어 있다. 최근성은 관측된 장애 단서를 유지하지만, 규칙의 결정 5 분기는 기억된 정체 수집 [stalled collect]에만 반응한다. 따라서 이 보고서는 유계 메커니즘과 그 검증 한계를 기록한다. 모집단 효과를 추정하지 않으며 LLM 학습, 동기, 생존, 종 간 동등도 보이지 않는다. 별도의 영/부정 개발 비교를 보존하고, 이후 경험 연구에 필요한 것을 명시한다.

용어

ORIGIN
프로젝트 고유명. 번역하지 않는다.
Sol-III
작성된 집수 세계의 고유명. 번역하지 않는다.
지연 의무 [delayed obligation]
결정 15 이후에만 채점되는 요건. 최종 비축이 5 이상. 그 전에 5를 넘어도 완료가 아니다.
정체 수집 [stalled collect]
수집 이후 비축의 가시적 증가가 없는 경우(감소 포함). 선택기 술어이며 숨은 원인을 지칭하지 않는다. 소스 식별자: stalledCollect.
선택기 [selector]
거주자가 볼 수 있는 아카이브 기록을 고르는 정책. 여기서는 priority 대 recency. 각각 기록 2건, UTF-8 8192바이트 상한.
실험 장치 [apparatus]
이미 기록된 결정론적 장치. 세계, 선택기, 제공기, 검증기, 저장된 에피소드. 이 보고서는 그것을 읽을 뿐 다시 실행하지 않는다.
거주자 [resident]
집수에서 행위하는 주체. 생물이 아니며 비축 0은 죽음이 아니다.
비축 [reserve]
작성된 세계의 유한 자원 카운터. 지연 의무는 최종 비축 ≥ 5를 요구한다.

1. 질문과 증거

연구 질문은 같다. 같은 기억 용량에서 거주자 자신이 관측한 실패 행동 경험을 최근 경험보다 우선하는 것이 지연 의무의 완료를 바꾸는가, 그리고 그 경험을 기억해도 행동이 그대로인 조건은 무엇인가. 현재의 답은 이미 완료된 결정론적 장치에 한정된다. 선택된 정보, 규칙에 의존하는 행동, 권위 있는 세계 변화, 결과를 따로 볼 수 있어 유용하다.

장치는 이번 연구 접수 이전에 완료되었다. 이 보고서는 소스, 수리된 기록, 저장된 에피소드 일곱, 파생 결정표를 읽는다. 소스/기록 감사와 그 저장 데이터에서 그린 그림을 더한다. 세계, Go 테스트나 검증기, 살아있는 모델, 하드웨어 실험은 실행하지 않는다. 외부 연구 메모 네 편이 후보 질문과 출처를 공급했으나 그 답은 경험 증거가 아니다. 동반 주장/출처 표는 독창 발견, 국소 관찰, 가설, 미검증 단서를 구별한다.

「실패」에는 조작적 정의가 필요하다. 선택기의 술어는 collect 이후 비축의 가시적 증가가 없는 것(감소 포함)이다. 숨은 인과 설명을 특정하지 않으며 행위가 거부되었다고 주장하지 않는다. 「지연」은 이후 자원 가용성에 영향을 주는 앞선 행위의 결과와, 결정 15 이후에만 평가되는 의무를 가리킨다. 「장기」는 이 유한 지평이며 무기한 배치가 아니다. 이 정의는 구현된 선택기와 장치 계약을 따른다.

2. 완료된 장치

기존의 Sol-III current 집수는 작성된 무차원 세계다. 소스는 초기 비축 4, effort 1, 저장된 자원 2, 장애를 정한다. 비축, effort, 저장에는 유한 상한이 있다. 거주자는 inspect, collect, clear, rest 중에서 고른다. clear는 장애 상태를 바꿔 이후 빗물 포획을 바꾼다. 현재 지각은 비축, effort, 관측 수치를 보이며 모든 세계 변수를 직접 보이지는 않는다. 자원과 생애주기 선언은 비축 0을 죽음으로 만들지 않는다. 거주자는 0에서도 계속 행동할 수 있다. 측정 종점은 기한의 보급이며 생존이 아니다. 이는 world.go의 소스 수준 서술이며 생물학적 실재의 주장이 아니다.

각 기억 기록은 한 거주자의 실제 행동 전 지각, 고른 행동, 전달된 행동 후 지각을 에피소드/실행 계보에 묶는다. 완전한 선행 기록만 적격이다. priority 선택기는 관측된 비축 변화가 비양인 collect를 먼저 순위한 뒤 최근성으로 채운다. 비교기는 최근성만으로 순위한다. 둘 다 선택된 기록을 시간순으로 반환하고, 과도한 후보를 건너뛰며, 선택 배열 전체를 기록 2건·8192바이트로 제한한다. 선택은 모델 가중치를 갱신하지 않는다. 호스트는 더 큰 아카이브와 생략 증거를 보유한다. 거주자 대면 기억 예산은 선택된 노출에 적용되며 컴퓨터 총저장이 아니다.

반응 팔 둘은 같은 무상태 작성 제공기를 쓴다. 규칙에는 명시적 시계가 있다. 결정 5(현재를 포함한 남은 11결정)에서는 가시 effort가 3 이상이고 선택 기억에 정체 수집이 있을 때만 clear한다. 중간 구간은 rest하고, 마지막 네 결정에서는 양의 effort로 collect한다. 더 이른 다른 분기는 기억과 현재 지각에 반응한다. 따라서 실험은 모델에게 전략 발견을 요구하지 않는다. 제공기 소스가 그 의존을 검사 가능하게 한다.

두 insensitive 통제는 현재 effort가 양이면 collect, 아니면 rest하며 선택된 기억을 쓰지 않는다. 세 문자 일정은 성공 경로, 결정 5의 clear를 rest로 바꾼 그 경로, 전부 rest를 점검한다. 지연 목표는 완전하고 유효한 16결정 에피소드의 최종 비축이 5 이상일 때만 충족된다. 그 전에 5를 넘어도 부족하다.

기록된 검증기는 채점 전에 매니페스트, 일지, 시도, 요청, 선택 기억, 행동, 관측, 종국 사실 사이의 대응을 재구성한다. 제공기 비의존이다. 거주자 자신은 여전히 작성된 제공기를 쓴다. 유효한 미충족 의무는 무효하거나 불완전한 증거와 다르다. 이 구분은 목표 실패를 무효 기록으로 조용히 버리는 것과, 형식이 갖춰진 추적을 성공 결과로 오인하는 것을 막는다.

3. 저장된 조건의 결과

기록된 일곱 조건은 각 16결정을 담는다. 112행의 결정은 중첩 측정이며 112개의 독립 표본이 아니다. 다음 값은 저장된 실행/검증 요약에서 읽고 대응 추출 종국 상태와 대조했다. 표본 기반 구간이나 p값이 없는, 기술적인 고정 조건 결과다. 저장 결과, 결정 추출.

조건최종 비축종단 의무
responsive-priority5충족
responsive-recency0미충족
insensitive-priority0미충족
insensitive-recency0미충족
literal-success-priority5충족
literal-no-clear-priority0미충족
literal-all-rest-priority0미충족
반응형 및 기억-비의존 선택기 쌍의 16회 결정별 비축. 가로로 밀어 확인.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

그림 1. 기존에 작성된 궤적. 반응형 쌍은 제거 결정과 이후 비축에서 갈라진다. 비의존 쌍의 행동과 상태는 동일하다. 요건은 결정 15에만 적용되며, 결정 0에서 비축이 5여도 완료가 아니다. 선은 기록된 결정 상태를 이을 뿐 추가 관측을 뜻하지 않는다.

결정 5에서 priority는 경험 [1,4]를 유지하고 clear하며, recency는 [3,4]를 유지하고 rest한다. 선택 기억 배열은 각각 2693과 2692바이트이고, 포착된 Petition JSON 크기는 5039과 5038바이트다. 따라서 같은 용량 상한이 동일한 바이트 수나 LLM 토큰 비용을 뜻하지는 않는다. 이는 바이트이며 토크나이저 측정이 아니다. 소스와 저장된 선택은 이 경계에서 기록 2건의 병목을 확립한다. 구속력 있는 8192바이트 병목은 확립하지 않는다.

두 반응 에피소드는 비축 5와 0으로 끝난다. 문자 대응은 같은 비축 궤적을 낸다. 작성된 장치에서 clear를 rest로 바꾸면 지연 결과가 바뀐다. 두 비의존 에피소드는 선택된 기억이 다른데도 16보 행동/상태 수열이 동일하다. 이는 지정된 결정 규칙에 대한 통제이지, 기억이 작용할 수 없다는 일반 결과가 아니다.

4. 차이가 식별하는 것

가장 강하게 지지되는 해석은 조건적이다. 선택 정책을 바꾸면 이 고정 반응 규칙에 공급되는 정보, 결정 5의 행동, 저장된 하류 결과가 바뀐다. 의존은 규칙에 설계되어 있다. 결과는 본질적으로 우월한 기억 표상이나 자발 학습을 식별하지 않는다.

저장된 최근성 운반체에 결정적 세부가 보인다. 결정 5의 선택 기억 바이트는 경험 3을 포함한다. inspect이며 사후 관측은 reading: 1, 관측된 장애 신호다. 제공기는 그런 사후 관측에서 깃발을 계산하지만, 남은 11결정 분기는 대신 stalledCollect를 본다. 이 경계에서 그 장애 깃발로 clear를 촉발하지 않는다. 따라서 패배한 최근성 팔을 잠재적으로 유용한 경고가 없었다고 말할 수 없다. 이는 직접적인 소스/기록 관찰이다. 다른 정책이 그 단서를 쓴다는 명제는 여기서 새로 수행한 실험이 아니라, 검증할 타당한 대안 설명이다. 저장 최근성 운반체, 반응 규칙.

비의존 비교에도 유지된 교정이 있다. 초기 통제는 정체 수집의 유무가 다를 것으로 기대했으나 두 팔 모두 하나를 유지했다. 교정된 통제는 동일한 세계 궤적에서 유지 경험이 다른 것이었다. 원래의 실패한 기대를 남기면 잘못된 통제 이야기가 양성 결과로 바뀌는 것을 막는다. 수리된 장치 기록이 그 이력을 남긴다.

이 집합의 어떤 조건도 지연이나 희소를 바꿔 그 필요성을 분리하지 않는다. 보고서는 그것들이 있는 상태에서 작동하는 메커니즘을 서술한다. 같은 선택기 대비가 어느 한 특징에만 의존한다거나, 낡은 실패, 바뀐 전제, 다른 정책, 미검토 세계에서 지속된다고 주장하지 않는다.

5. 검증 자체가 증거의 대상이다

제공기 실행과 엄격 재생은 작성된 규칙을 공유한다. 일치는 일관성을 세우면서도 문서화된 계약에서의 공유 일탈을 놓칠 수 있다. 보존된 사적 오류 변종은 최종 수집 창을 4결정에서 3으로 줄였다. 그 사본의 엄격 검증은 에피소드를 수리했지만, 결정 12는 독립적으로 기대된 collect가 아니라 inspect를 반환했다. 원래 제품 규칙은 옳았다. 정책 변경 후 비축 4는 선택기의 부정 결과가 아니다.

가산 테스트는 결정 11·12·15, 양/영 effort, 빈/유지 정체 수집 기억에 걸친 문자 기대 열둘을 공급했다. 역사 로그는 미수정 통제의 통과와, 의도한 어서션에 실패한 컴파일 가능한 오류 변종 셋을 기록한다. 이번 연구 접수에서 구현 로그 해시 여덟과 현재 테스트 파일 해시가 모두 기록값과 일치했고, 관련 실패 선택 메시지를 검사했다. 이는 역사 증거의 새 무결성/열람 점검이며 새로 실행한 테스트가 아니다. 수리 감사, 문자 테스트, 기록된 명령과 로그.

현재 바이트 점검은 저장된 에피소드 파일 140개를 기존 영수증 일곱과, 아카이브된 소스/모듈 항목 95개를 responsive-priority 매니페스트와 맞췄다. 검사한 꾸러미의 무결성을 지지한다. 원래 실행된 바이너리가 무엇인지를 증언하지 않고, 모든 컴파일러 입력이 아카이브되었음을 세우지 않으며, 새 독립 재현을 대체하지 않는다. 보고서는 문서화된 소스 발견 한계를 남긴다. 컴파일 사용은 빌드 경로의 소스 체크아웃과 -trimpath 없는 빌드를 요구한다. 전체 기반, 충돌 복구, 저장소 전역 올바름 주장은 이 기록 밖이다.

6. 별도의 이전 개발 증거

더 오래된 논문 준비 데이터셋은 작성 궤적 여덟, 중첩 시각 128, adaptive/baseline 프로파일 비교 넷을 담는다. 지표는 각 ProcessMoment 이후 휴대 비축을 시각 0–15에서 합한 것으로, 비축 단위·시각으로 잰다. adaptive 빼기 baseline 차이는 +4, 0, 0, −1이다. 위의 priority/recency 개입이 아니며 종단점도 공유하지 않는다. 정의, 네 비교.

이전 개발 프로파일 차이 네 건: current는 +4, shifted는 0, clustered는 0, sparse는 −1. 가로로 밀어 확인.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

그림 2. 이전의 고정 프로파일 비교 네 건 전부. 원래의 누적 지표를 쓴다. 음수와 0은 유지한다. 이 그림은 별도의 개발 맥락이며 그림 1의 추가 표본이 아니다.

그 이전 접수에는 역사적 로컬 모델 타당성 시험 둘과 장치 위상 행 둘도 목록된다. 어느 것도 일곱 결정론 조건에 더해 행동 표본을 넓힐 수 없다. 재생, 재시도, 재채점, 한 궤적의 여러 행은 계보를 유지한다. 이전 current, shifted, clustered, sparse 프로파일은 이미 검사되었고, 이름만 바꿔 맹검 홀드아웃이 될 수 없다.

7. 문헌에서의 위치

기억 시스템은 구별해야 할 개입을 결합한다. Generative Agents는 접근 기반 최근성, 중요도, 관련성을 포함한 검색 인자를 결합하며, 면담 제거는 전체 구조가 쌓은 이력을 쓴다. 그 평가는 공통 이력 결정 탐침과 완전 궤적 개입을 나누는 동기가 된다. 이 집수 결과를 검증하지 않는다. Park et al., 2023, §§4.1 and 6.1–6.2.

Reflexion은 기저 모델 가중치를 바꾸지 않고 텍스트 피드백으로 이후 맥락을 바꾼다. WebShop 부록은 시도한 개선이 나타나지 않은 설정도 보고한다. 메커니즘과 그 한계 모두 기억이나 성찰을 무조건 이득으로 다루는 데 반대한다. 이 장치와는 다른 과제와 시행 구조다. Shinn et al., 2023, abstract and Appendix B.1.

이후 경험 연구에서 표본 크기는 추론 목표와 정당한 가정을 따라야 한다. 정밀 계획에는 예를 들어 목표 구간 폭과 변동 설명이 필요하다. ORIGIN 실행의 보편적 충분 수를 주는 논문은 없다. Lakens, 2022, “Planning for Precision”.

ACM의 산출물 용어에서 산출물 가용성/기능과 독립적으로 얻은 결과는 별개의 성취다. 이 보고서는 국소 무결성 감사와 재현 가능한 그림 도출을 제공한다. 심사 배지나 독립 실험 재현을 주장하지 않는다. ACM SIGIR artifact criteria.

LongMemEval은 신탁 검색 증거로 읽기 전략을 평가하며, 증거 세션이 주어져도 독자 설계가 QA 성능에 영향을 줌을 보인다. 채팅 이력 QA 과제 안에서 검색과 사용의 구분을 강화한다. 지속 세계 행동은 측정하지 않는다. Wu et al., v2, §5.5.

XENON은 경험 기억을 의존 교정과 후보 행동 교정에 결합한다. 따라서 이 장치의 선택기를 고정한 채 에피소드 노출을 바꾸는 것과는 다른 개입의 참조다. Lee et al., v3, §§4.1–4.2.

Vending-Bench는 최근 맥락 한계를 명시적 저장 제약 없는 외부 기억 도구와 나눈다. 원래 GPT-4o-mini 맥락 용량 제거는 더 큰 한계에서 더 나쁜 결과를 보고한다. 모든 기억 층을 하나의 예산으로 다루거나 단조 이득을 가정하지 말라는 경고다. 그 업무 영역과 역사 모델은 ORIGIN 결과가 아니다. Backlund and Petersson, v1, §§2.1 and 3.5.2.

Agarwal와 동료들의 소수 실행 강화학습 분석은 확률적 훈련/평가 실행 간 변동을 다룬다. 통계 권고는 적절한 표본 구조를 요구하며 이 일곱 작성 조건에 신뢰구간을 주지 않는다. Agarwal et al., NeurIPS 2021.

인간/비인간 및 계산/양자 발견은 별도 포트폴리오 입력이며 현재 결과의 증거가 아니다. 소스 재결은 인정된 범위와 너무 좁거나 불완전한 수집 요약에 대한 교정을 기록한다.

8. 반증 가능한 후속

다음 경험 질문은 선언된 모델/과제 분포에서 선택기 대비가 완전 에피소드 목표 확률을 바꾸는지일 수 있다. 방향은 열려 있어야 한다. 유용한 음성 결과는 관련 실패 기록을 유지하면서 고른 행동이나 종단 결과를 개선하지 않는 것이다. 해로운 결과 또한 정보가 된다. 현재의 소스 검사는 유지와 결정 규칙의 단서 사용 계약을 나누는 동기를 더한다.

어떤 수집 전에 적격 관측, 접근 가능한 저장과 결정별 노출, 선택기/동점/넘침 규칙, 전달 프롬프트, 모델과 요청/보고 버전, 자원 한계, 세계/초기 상태 분포, 보호 홀드아웃, 기한, 독립 채점 기대, 실패/재시도 계보, 정지 규칙, 주분석을 정한다. 허용 자원 상한을 맞추면서 실제 소비를 보고한다. 개입 후 세계/관측 궤적을 같게 강제하지 말라. 그 차이가 연구 중인 효과를 나를 수 있다.

완전 에피소드를 단위로 쓰고, 과제 블록이나 쌍을 선언하라. 상호작용하는 거주자의 공유 세계는 집단/세계 단위가 필요하다. 결과를 보기 전에 시작한 모든 에피소드의 분모와 얻을 수 없는 결과의 처리를 밝혀라. 공통 시드는 궤적이 갈라진 뒤 모델 난수가 대응함을 보장하지 않는다. 의미 있는 효과 또는 정밀 목표를 고르고, 방어 가능한 가정 아래에서 표본 크기 민감도를 평가하라. 이 양은 여기서 미설정이다. 이는 제안 연구이며 사전등록도, 완료된 경험 결과도 아니다.

9. 재현과 이용 가능성

기저 소스와 런타임 기록은 사적으로 남는다. 이 열람판은 내부 심사를 거친 초안의 과학 주장과 기록값을 보존한다. 본문의 국소 소스와 감사 지칭은 그 사적 꾸러미의 기록을 가리킨다. 공개 산출물 링크가 아니다.

두 SVG 그림은 이 사이트를 위해 수리된 추출·비교 값에서 다시 그렸다. 그림 값으로 그린 점을 검사할 수 있다. 그림을 다시 그리는 것은 세계를 재생하는 것과 다르다. 이 파생 값은 기저 소스, 에피소드 기록, 독립 채점기를 대체하지 않는다.

공개 연구 릴리스에는 여전히 책임 있는 저자 표기, 동결된 소스/데이터와 삭제 묶음, 안정된 산출물 링크, 그 릴리스 꾸러미의 심사가 필요하다. 여기서는 지정되지도 공개되지도 않았다. 완료된 내부 심사는 기술 원고와 그 그림을 덮는다. 저널 동료심사도, 독립 장치 실행도 아니다. 교정은 연구 기록의 일부로 남는다.

개정 이력

2026년 9월 9일. 내부 심사를 거친 기술 초안의 웹사이트 열람판. 과학 주장과 기록값은 유지한다. 로컬 파일시스템 링크는 생략하고, 두 그림은 같은 기록값에서 어두운 열람면용으로 다시 그린다. 소스와 런타임 기록은 사적으로 남는다. 공개 산출물 릴리스도, 저널 동료심사도 아니다. 인터페이스 로케일은 이 열람판의 완역을 포함한다. 영어 본문이 원문이다.

Resumen

Una memoria limitada puede cambiar las acciones futuras de un agente, pero almacenar un fallo pasado no establece aprendizaje ni garantiza que la información se use. Examinamos un aparato ORIGIN existente en el que dos selectores deterministas exponen experiencias pasadas distintas a una regla de decisión fija. Un residente actúa en una cuenca redactada con recursos limitados durante 16 decisiones y debe terminar con al menos cinco unidades de reserva. Ambos selectores permiten dos registros y como máximo 8192 bytes UTF-8 canónicos. El episodio archivado responsive-priority alcanza la obligación; su contraparte de recencia no. Dos controles que ignoran la memoria seleccionada siguen secuencias idénticas de acción/estado y ambos fallan la obligación. La dependencia decisiva está redactada de forma explícita: la recencia retiene una pista de obstrucción observada, pero la rama de la decisión 5 de la regla responde específicamente a un stalled collect recordado. El informe documenta por tanto un mecanismo acotado y los límites de su verificación. No estima un efecto poblacional ni demuestra aprendizaje de LLM, motivación, supervivencia o equivalencia entre especies. Conservamos comparaciones de desarrollo nulas/adversas por separado y especificamos lo que necesitaría un estudio empírico posterior.

Términos

ORIGIN
Nombre propio del proyecto. No se traduce.
Sol-III
Nombre propio del mundo de cuenca redactado. No se traduce.
obligación diferida [delayed obligation]
Requisito puntuado solo tras la decisión 15: reserva final de al menos cinco. Superar cinco antes no es compleción.
recolección estancada [stalled collect]
Una acción collect sin aumento visible de reserva, incluida una disminución. Predicado del selector; no nombra una causa oculta. Identificador de fuente: stalledCollect.
selector
La política que elige qué registros archivados puede ver un residente. Aquí: priority frente a recency, cada uno con tope de dos registros y 8192 bytes UTF-8.
aparato [apparatus]
El montaje determinista ya registrado: mundo, selectores, proveedor, verificador y episodios guardados. Este informe lo lee; no lo vuelve a ejecutar.
residente [resident]
El agente que actúa en la cuenca. No es un organismo biológico; reserva cero no es muerte.
reserva [reserve]
El contador finito de recurso en el mundo redactado. La obligación diferida exige reserva final ≥ 5.

1. La pregunta y la evidencia

La pregunta de investigación es si priorizar las experiencias de acción fallida observadas por el propio residente frente a las recientes, con la misma capacidad de memoria, cambia la compleción de una obligación diferida —y bajo qué condiciones recordar esas experiencias deja el comportamiento igual. La respuesta presente se limita a un aparato determinista ya completado. Es útil porque la información seleccionada, la acción dependiente de la regla, el cambio de mundo con autoridad y el resultado pueden examinarse por separado.

El aparato se completó antes de esta toma de investigación. Este informe lee su fuente, los registros aceptados, siete episodios guardados y la tabla de decisiones derivada. Añade una auditoría de fuente/registro y figuras derivadas de esos datos guardados. No ejecuta el mundo, una prueba o verificador Go, un modelo en vivo ni un experimento de hardware. Cuatro memorandos de investigación externos aportaron preguntas y fuentes candidatas; sus respuestas no son evidencia empírica. La tabla compañera de afirmaciones/fuentes distingue hallazgos originales, observaciones locales, hipótesis y pistas no verificadas.

«Fallo» exige una definición operativa. El predicado del selector es una acción collect seguida de ningún aumento visible de reserva, incluida una disminución. No identifica una explicación causal oculta ni afirma que la acción fuera rechazada. «Diferida» se refiere a consecuencias de acciones anteriores que afectan la disponibilidad posterior de recurso y a una obligación evaluada solo tras la decisión 15. «A largo plazo» denota este horizonte finito; no significa un despliegue indefinido. Estas definiciones siguen el selector implementado y el contrato del aparato.

2. El aparato completado

La cuenca Sol-III current existente es un mundo redactado y adimensional. Su fuente define reserva inicial 4, effort 1, recurso almacenado 2 y una obstrucción. Reserva, effort y almacén tienen techos finitos. El residente elige entre inspect, collect, clear y rest. Despejar cambia el estado del obstáculo y con ello la captura posterior de lluvia. La percepción actual expone reserva, effort y una lectura de observación; no expone directamente cada variable del mundo. Las declaraciones de recurso y ciclo de vida no convierten la reserva cero en muerte: los residentes pueden seguir actuando en cero. El extremo medido es por tanto el aprovisionamiento en un plazo, no la supervivencia. Son descripciones a nivel de fuente de world.go, no afirmaciones de realismo biológico.

Cada registro de memoria vincula la percepción real previa a la acción de un residente, la acción elegida y la percepción posterior entregada a un linaje de episodio/ejecución. Solo son elegibles registros previos completos. El selector priority ordena primero los collect con cambio de reserva observado no positivo, luego rellena por recencia. El comparador ordena solo por recencia. Ambos devuelven los registros seleccionados en orden cronológico, omiten candidatos excesivos y limitan todo el arreglo seleccionado a dos registros y 8192 bytes. La selección no actualiza pesos de modelo. El anfitrión retiene el archivo mayor y la evidencia de omisión; el presupuesto de memoria frente al residente se aplica a la exposición seleccionada, no al almacenamiento total del computador.

Ambos brazos sensibles usan el mismo proveedor redactado sin estado. Su regla tiene un reloj explícito: en la decisión 5, correspondiente a once decisiones restantes incluida la actual, despeja solo si el effort visible es al menos tres y la memoria seleccionada contiene un stalled collect. Descansa en el intervalo medio y recolecta con effort positivo en las cuatro decisiones finales. Otras ramas anteriores responden a la memoria y a la percepción actual. Así el experimento no pide a un modelo que descubra una estrategia. La fuente del proveedor hace inspectable la dependencia.

Dos controles insensitive recolectan cuando el effort actual es positivo y si no descansan, sin usar la memoria seleccionada. Tres horarios literales comprueban una vía exitosa, esa vía con el despeje de la decisión 5 sustituido por rest, y el comportamiento de todo rest. La meta diferida se satisface solo cuando un episodio completo y válido de 16 decisiones tiene reserva final de al menos cinco. Cruzar cinco antes no basta.

El verificador registrado reconstruye la correspondencia entre manifiestos, diarios, intentos, solicitudes, memorias seleccionadas, acciones, observaciones y hechos finales antes de puntuar. No depende del proveedor; el residente mismo sigue usando un proveedor redactado. Una obligación incumplida válida es distinta de evidencia inválida o incompleta. Esta distinción evita que un fallo de meta se descarte en silencio como registro inválido y que una traza bien formada se tome por un resultado exitoso.

3. Resultados en las condiciones guardadas

Las siete condiciones registradas contienen 16 decisiones cada una. Sus 112 filas de decisión son mediciones anidadas, no 112 muestras independientes. Los valores siguientes se leyeron de resúmenes guardados de ejecución/verificación y se contrastaron con los estados finales extraídos correspondientes. Son resultados descriptivos de condición fija, sin intervalo ni valor p basados en muestreo. Resultados guardados, extracción de decisiones.

CondiciónReserva finalObligación terminal
responsive-priority5Cumplida
responsive-recency0Incumplida
insensitive-priority0Incumplida
insensitive-recency0Incumplida
literal-success-priority5Cumplida
literal-no-clear-priority0Incumplida
literal-all-rest-priority0Incumplida
Reserva tras cada una de 16 decisiones para pares de selectores sensibles e insensibles a la memoria. Desplaza en horizontal para inspeccionar.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Figura 1. Trayectorias ya redactadas. El par sensible difiere en la decisión de despeje y luego en la reserva. El par insensible tiene acciones y estados idénticos. El requisito rige solo en la decisión 15; una reserva de cinco en la decisión 0 no es compleción. Las líneas unen estados de decisión registrados y no denotan observaciones adicionales.

En la decisión 5, priority retiene las experiencias [1,4] y despeja; recency retiene [3,4] y descansa. Sus arreglos de memoria seleccionada contienen 2693 y 2692 bytes respectivamente, y los tamaños JSON de Petition capturados son 5039 y 5038 bytes. Unos techos de capacidad iguales no implican por tanto recuentos de bytes idénticos ni costes de tokens de LLM. Son bytes, no medidas de tokenizador. La fuente y la selección guardada establecen un cuello de dos registros en este límite; no establecen un cuello vinculante de 8192 bytes.

Los dos episodios sensibles terminan con reserva 5 y 0. Sus contrapartes literales dan las mismas trayectorias de reserva; sustituir el despeje por rest cambia el resultado diferido en el montaje redactado. Los dos episodios insensibles tienen secuencias idénticas de 16 pasos de acción/estado pese a memorias seleccionadas distintas. Es un control para la regla de decisión especificada, no un resultado general de que la memoria no pueda importar.

4. Lo que identifica la diferencia

La interpretación más respaldada es condicional: cambiar la política de selección cambia la información suministrada a esta regla sensible fija, su acción en la decisión 5 y el resultado posterior guardado. La dependencia está ingenierizada en la regla. El resultado no identifica una representación de memoria intrínsecamente superior ni un aprendizaje espontáneo.

Un detalle crítico es visible en el portador de recencia guardado. Sus bytes de memoria seleccionada en la decisión 5 incluyen la experiencia 3, una acción inspect cuya postobservación tiene reading: 1, la señal de obstrucción observada. El proveedor calcula una bandera a partir de tales postobservaciones, pero la rama de once decisiones restantes comprueba stalledCollect en su lugar. No usa esa bandera de obstrucción para disparar el despeje en este límite. En consecuencia, el brazo de recencia perdedor no puede describirse como carente de aviso potencialmente útil. Es una observación directa de fuente/registro; la proposición de que otra política explotaría la pista es una explicación alternativa plausible a probar, no un experimento nuevo realizado aquí. Portador de recencia guardado, regla sensible.

La comparación insensible también tiene una corrección retenida. Un control inicial esperaba distinta presencia/ausencia de stalled collects, pero ambos brazos retuvieron uno. El control corregido concernía experiencias retenidas distintas con trayectorias de mundo idénticas. Retener la expectativa fallida original evita que una historia de control equivocada se convierta en un resultado positivo. El registro aceptado del aparato documenta esa historia.

Ninguna condición de este conjunto aísla la necesidad del retraso o de la escasez al variarlas. El informe describe un mecanismo que opera en su presencia. No afirma que el mismo contraste de selectores dependa de forma única de ninguno de los dos rasgos, ni que persista bajo fallos obsoletos, prerrequisitos cambiados, políticas distintas o mundos no examinados.

5. La verificación es ella misma un objeto de evidencia

La ejecución del proveedor y la reejecución estricta comparten una regla redactada. Su acuerdo puede establecer consistencia y a la vez perder una desviación compartida del contrato documentado. Una variante privada errónea conservada acortó la ventana final de recolección de cuatro decisiones a tres; la verificación estricta de esa copia aceptó el episodio, mientras que la decisión 12 devolvió inspect en lugar del collect esperado de forma independiente. La regla de producto original era correcta. La reserva de cuatro de la política cambiada no es un resultado adverso del selector.

Una prueba aditiva suministró luego doce expectativas literales que cubren las decisiones 11, 12 y 15, effort positivo/cero y memoria de stalled collect vacía/retenida. Los registros históricos anotan que el control no modificado pasa y que tres variantes erróneas compilables fallan las aserciones previstas. En esta toma de investigación, los ocho hashes de registro de implementación y el hash actual del archivo de prueba coincidieron con sus valores registrados, y se inspeccionaron los mensajes de elección fallida pertinentes. Son comprobaciones nuevas de integridad/lectura de evidencia histórica, no pruebas recién ejecutadas. Auditoría de aceptación, prueba literal, órdenes y registros grabados.

Las comprobaciones de bytes actuales también emparejaron los 140 archivos de episodio guardados con los siete recibos existentes y las 95 entradas archivadas de fuente/módulo con el manifiesto responsive-priority. Esto sostiene la integridad del paquete inspeccionado. No atestigua qué binario se ejecutó originalmente, no establece que toda entrada del compilador esté archivada ni sustituye una reproducción independiente reciente. El informe conserva la limitación documentada de descubrimiento de fuente: el uso compilado exige el checkout de fuente en su ruta de construcción y una construcción sin -trimpath. Las afirmaciones de infraestructura completa, recuperación de fallos y corrección de todo el repositorio quedan fuera de este registro.

6. Evidencia de desarrollo anterior, aparte

El conjunto de datos más antiguo de preparación de artículo contiene ocho trayectorias redactadas, 128 momentos anidados y cuatro comparaciones de perfiles adaptive/baseline. Su métrica es la suma de la reserva llevada tras cada ProcessMoment en los momentos 0–15, medida en momentos-unidad de reserva. Las diferencias adaptive menos baseline son +4, 0, 0 y −1. No son la intervención priority/recency de arriba y no comparten su extremo terminal. Definiciones, cuatro comparaciones.

Cuatro diferencias de perfiles de desarrollo anteriores: current más cuatro, shifted cero, clustered cero, sparse menos uno. Desplaza en horizontal para inspeccionar.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Figura 2. Las cuatro comparaciones fijas de perfiles anteriores, con su métrica acumulada original. Se conservan los valores adversos y nulos. Esta figura es contexto de desarrollo aparte; no es muestreo adicional para la Figura 1.

En esa toma más antigua también se catalogan dos ensayos históricos de viabilidad de modelo local y dos filas de topología de aparato. Ninguno puede añadirse a las siete condiciones deterministas para ampliar una muestra de comportamiento. Las reejecuciones, reintentos, revaluaciones y las filas múltiples de una trayectoria conservan su linaje. Los perfiles más antiguos current, shifted, clustered y sparse ya se inspeccionaron y no pueden volverse una reserva ciega al renombrarlos.

7. Posición en la literatura

Los sistemas de memoria combinan intervenciones que deben distinguirse. Generative Agents combina factores de recuperación que incluyen recencia por acceso, importancia y relevancia; sus ablaciones de entrevista usan historias acumuladas por la arquitectura completa. Esa evaluación motiva separar sondas de decisión de historia común de intervenciones de trayectoria completa. No valida este resultado de cuenca. Park et al., 2023, §§4.1 and 6.1–6.2.

Reflexion cambia el contexto posterior mediante retroalimentación textual, no cambiando los pesos del modelo base. Su apéndice WebShop también informa un ajuste en el que la mejora intentada no se materializó. Tanto el mecanismo como esa limitación argumentan contra tratar la memoria o la reflexión como un beneficio incondicional. Conciernen tareas y estructuras de ensayo distintas de este aparato. Shinn et al., 2023, abstract and Appendix B.1.

Para un estudio empírico posterior, el tamaño muestral debe seguir un objetivo inferencial y supuestos justificados. La planificación basada en precisión, por ejemplo, exige una anchura de intervalo objetivo y una cuenta de la variabilidad; ningún artículo suministra un número suficiente universal de ejecuciones ORIGIN. Lakens, 2022, “Planning for Precision”.

La disponibilidad/funcionalidad de artefactos y los resultados obtenidos de forma independiente son logros separados en la terminología de artefactos de ACM. Este informe ofrece una auditoría local de integridad y una derivación reproducible de figuras; no reclama una insignia de revisión ni una replicación experimental independiente. ACM SIGIR artifact criteria.

LongMemEval evalúa estrategias de lectura con evidencia recuperada por oráculo y muestra que el diseño del lector afecta el rendimiento de QA incluso cuando se suministran las sesiones de evidencia. Esto refuerza la distinción entre recuperación y uso, dentro de una tarea de QA de historial de chat. No mide la acción en un mundo persistente. Wu et al., v2, §5.5.

XENON acopla la memoria de experiencia a la corrección de dependencias y a la corrección de acciones candidatas. Es por tanto una referencia para una intervención distinta de cambiar la exposición de episodios manteniendo fijo el selector de este aparato. Lee et al., v3, §§4.1–4.2.

Vending-Bench separa los límites de contexto reciente de las herramientas de memoria externa sin restricciones explícitas de almacenamiento. Su ablación original de capacidad de contexto de GPT-4o-mini informa peores resultados con límites mayores. Esto advierte contra tratar cada capa de memoria como un solo presupuesto o asumir un beneficio monótono; su dominio de negocio y sus modelos históricos no son resultados ORIGIN. Backlund and Petersson, v1, §§2.1 and 3.5.2.

El análisis de RL de pocas ejecuciones de Agarwal y colegas concierne la variabilidad entre ejecuciones estocásticas de entrenamiento/evaluación. Sus recomendaciones estadísticas exigen una estructura de muestreo apropiada y no suministran intervalos de confianza para estas siete condiciones redactadas. Agarwal et al., NeurIPS 2021.

Los hallazgos humanos/no humanos y de cómputo/cuántica siguen siendo entradas de portafolio separadas, no evidencia del resultado presente. La adjudicación de fuentes registra el alcance admitido y las correcciones a resúmenes de recolección demasiado estrechos o incompletos.

8. Una continuación falseable

Una siguiente pregunta empírica podría preguntar si el contraste de selectores cambia la probabilidad de meta de episodio completo para una distribución declarada de modelo/tarea. La dirección debe permanecer abierta. Un resultado negativo útil retendría un registro de fallo pertinente sin mejorar la acción elegida ni el resultado terminal; un resultado dañino también informaría. La inspección de fuente presente motiva además a distinguir la retención del contrato de uso de pistas de la regla de decisión.

Antes de cualquier recolección, defínanse las observaciones elegibles, el almacenamiento accesible y la exposición por decisión, las reglas de selector/empate/desborde, las indicaciones entregadas, el modelo y la versión pedida/informada, los límites de recurso, la distribución de mundo/estado inicial, la reserva protegida, el plazo, las expectativas del puntuador independiente, el linaje de fallo/reintento, la regla de parada y el análisis primario. Ajústense los techos de recurso permitidos informando el consumo real. No se fuerce a que las trayectorias de mundo/observación posteriores a la intervención permanezcan iguales; esas diferencias pueden llevar el efecto estudiado.

Úsense episodios completos como unidades, con bloques o pares de tarea declarados. Los mundos compartidos con residentes que interactúan requieren unidades de grupo/mundo. Establézcase el denominador de todos los episodios lanzados y el trato de resultados no disponibles antes de mirar los resultados. Una semilla común no garantiza aleatoriedad de modelo correspondiente tras divergir las trayectorias. Elíjase un efecto significativo o un objetivo de precisión y evalúese la sensibilidad del tamaño muestral bajo supuestos defendibles; estas cantidades quedan sin fijar aquí. Es un estudio propuesto, no un preregistro ni un resultado empírico completado.

9. Reproducción y disponibilidad

La fuente subyacente y los registros de ejecución siguen siendo privados. Esta edición de lectura conserva las afirmaciones científicas y los valores registrados del borrador revisado internamente. Las referencias locales de fuente y auditoría en el texto nombran registros de ese paquete privado; no son enlaces públicos de artefactos.

Las dos figuras SVG se redibujan a partir de los valores de extracción y comparación aceptados para este sitio. Los valores de las figuras permiten inspeccionar los puntos trazados. Reconstruir una figura no es reejecutar el mundo. Estos valores derivados no sustituyen la fuente subyacente, los registros de episodio ni el puntuador independiente.

Una publicación de investigación pública sigue exigiendo autoría responsable, un paquete congelado de fuente/datos y redacción, enlaces estables de artefactos y revisión de ese paquete de publicación. Aquí no se han asignado ni publicado. La revisión interna completada cubre el manuscrito técnico y sus figuras; no es revisión por pares de revista ni ejecución independiente del aparato. Las correcciones siguen formando parte del registro de investigación.

Historial de revisiones

9 de septiembre de 2026. Edición de lectura web del borrador técnico revisado internamente. Se conservan las afirmaciones científicas y los valores registrados. Se omiten enlaces al sistema de archivos local; las dos figuras se redibujan a partir de los mismos valores registrados para una superficie de lectura oscura. Fuente y registros de ejecución siguen privados. No es una publicación pública de artefactos ni revisión por pares de revista. Las interfaces incluyen una traducción completa de esta edición de lectura; el texto inglés sigue siendo el original.

Resumen

Una memoria limitada puede cambiar las acciones futuras de un agente, pero almacenar un fallo pasado no establece aprendizaje ni garantiza que la información se use. Examinamos un aparato ORIGIN existente en el que dos selectores deterministas exponen experiencias pasadas distintas a una regla de decisión fija. Un residente actúa en una cuenca redactada con recursos limitados durante 16 decisiones y debe terminar con al menos cinco unidades de reserva. Ambos selectores permiten dos registros y como máximo 8192 bytes UTF-8 canónicos. El episodio archivado responsive-priority alcanza la obligación; su contraparte de recencia no. Dos controles que ignoran la memoria seleccionada siguen secuencias idénticas de acción/estado y ambos fallan la obligación. La dependencia decisiva está redactada de forma explícita: la recencia retiene una pista de obstrucción observada, pero la rama de la decisión 5 de la regla responde específicamente a un stalled collect recordado. El reporte documenta por tanto un mecanismo acotado y los límites de su verificación. No estima un efecto poblacional ni demuestra aprendizaje de LLM, motivación, supervivencia o equivalencia entre especies. Conservamos comparaciones de desarrollo nulas/adversas por separado y especificamos lo que necesitaría un estudio empírico posterior.

Términos

ORIGIN
Nombre propio del proyecto. No se traduce.
Sol-III
Nombre propio del mundo de cuenca redactado. No se traduce.
obligación diferida [delayed obligation]
Requisito puntuado solo tras la decisión 15: reserva final de al menos cinco. Superar cinco antes no es compleción.
recolección estancada [stalled collect]
Una acción collect sin aumento visible de reserva, incluida una disminución. Predicado del selector; no nombra una causa oculta. Identificador de fuente: stalledCollect.
selector
La política que elige qué registros archivados puede ver un residente. Aquí: priority frente a recency, cada uno con tope de dos registros y 8192 bytes UTF-8.
aparato [apparatus]
El montaje determinista ya registrado: mundo, selectores, proveedor, verificador y episodios guardados. Este reporte lo lee; no lo vuelve a ejecutar.
residente [resident]
El agente que actúa en la cuenca. No es un organismo biológico; reserva cero no es muerte.
reserva [reserve]
El contador finito de recurso en el mundo redactado. La obligación diferida exige reserva final ≥ 5.

1. La pregunta y la evidencia

La pregunta de investigación es si priorizar las experiencias de acción fallida observadas por el propio residente frente a las recientes, con la misma capacidad de memoria, cambia la compleción de una obligación diferida —y bajo qué condiciones recordar esas experiencias deja el comportamiento igual. La respuesta presente se limita a un aparato determinista ya completado. Es útil porque la información seleccionada, la acción dependiente de la regla, el cambio de mundo con autoridad y el resultado pueden examinarse por separado.

El aparato se completó antes de esta toma de investigación. Este reporte lee su fuente, los registros aceptados, siete episodios guardados y la tabla de decisiones derivada. Añade una auditoría de fuente/registro y figuras derivadas de esos datos guardados. No ejecuta el mundo, una prueba o verificador Go, un modelo en vivo ni un experimento de hardware. Cuatro memorandos de investigación externos aportaron preguntas y fuentes candidatas; sus respuestas no son evidencia empírica. La tabla compañera de afirmaciones/fuentes distingue hallazgos originales, observaciones locales, hipótesis y pistas no verificadas.

«Fallo» exige una definición operativa. El predicado del selector es una acción collect seguida de ningún aumento visible de reserva, incluida una disminución. No identifica una explicación causal oculta ni afirma que la acción fuera rechazada. «Diferida» se refiere a consecuencias de acciones anteriores que afectan la disponibilidad posterior de recurso y a una obligación evaluada solo tras la decisión 15. «A largo plazo» denota este horizonte finito; no significa un despliegue indefinido. Estas definiciones siguen el selector implementado y el contrato del aparato.

2. El aparato completado

La cuenca Sol-III current existente es un mundo redactado y adimensional. Su fuente define reserva inicial 4, effort 1, recurso almacenado 2 y una obstrucción. Reserva, effort y almacén tienen techos finitos. El residente elige entre inspect, collect, clear y rest. Despejar cambia el estado del obstáculo y con ello la captura posterior de lluvia. La percepción actual expone reserva, effort y una lectura de observación; no expone directamente cada variable del mundo. Las declaraciones de recurso y ciclo de vida no convierten la reserva cero en muerte: los residentes pueden seguir actuando en cero. El extremo medido es por tanto el aprovisionamiento en un plazo, no la supervivencia. Son descripciones a nivel de fuente de world.go, no afirmaciones de realismo biológico.

Cada registro de memoria vincula la percepción real previa a la acción de un residente, la acción elegida y la percepción posterior entregada a un linaje de episodio/ejecución. Solo son elegibles registros previos completos. El selector priority ordena primero los collect con cambio de reserva observado no positivo, luego rellena por recencia. El comparador ordena solo por recencia. Ambos devuelven los registros seleccionados en orden cronológico, omiten candidatos excesivos y limitan todo el arreglo seleccionado a dos registros y 8192 bytes. La selección no actualiza pesos de modelo. El anfitrión retiene el archivo mayor y la evidencia de omisión; el presupuesto de memoria frente al residente se aplica a la exposición seleccionada, no al almacenamiento total de la computadora.

Ambos brazos sensibles usan el mismo proveedor redactado sin estado. Su regla tiene un reloj explícito: en la decisión 5, correspondiente a once decisiones restantes incluida la actual, despeja solo si el effort visible es al menos tres y la memoria seleccionada contiene un stalled collect. Descansa en el intervalo medio y recolecta con effort positivo en las cuatro decisiones finales. Otras ramas anteriores responden a la memoria y a la percepción actual. Así el experimento no pide a un modelo que descubra una estrategia. La fuente del proveedor hace inspectable la dependencia.

Dos controles insensitive recolectan cuando el effort actual es positivo y si no descansan, sin usar la memoria seleccionada. Tres horarios literales comprueban una vía exitosa, esa vía con el despeje de la decisión 5 sustituido por rest, y el comportamiento de todo rest. La meta diferida se satisface solo cuando un episodio completo y válido de 16 decisiones tiene reserva final de al menos cinco. Cruzar cinco antes no basta.

El verificador registrado reconstruye la correspondencia entre manifiestos, diarios, intentos, solicitudes, memorias seleccionadas, acciones, observaciones y hechos finales antes de puntuar. No depende del proveedor; el residente mismo sigue usando un proveedor redactado. Una obligación incumplida válida es distinta de evidencia inválida o incompleta. Esta distinción evita que un fallo de meta se descarte en silencio como registro inválido y que una traza bien formada se tome por un resultado exitoso.

3. Resultados en las condiciones guardadas

Las siete condiciones registradas contienen 16 decisiones cada una. Sus 112 filas de decisión son mediciones anidadas, no 112 muestras independientes. Los valores siguientes se leyeron de resúmenes guardados de ejecución/verificación y se contrastaron con los estados finales extraídos correspondientes. Son resultados descriptivos de condición fija, sin intervalo ni valor p basados en muestreo. Resultados guardados, extracción de decisiones.

CondiciónReserva finalObligación terminal
responsive-priority5Cumplida
responsive-recency0Incumplida
insensitive-priority0Incumplida
insensitive-recency0Incumplida
literal-success-priority5Cumplida
literal-no-clear-priority0Incumplida
literal-all-rest-priority0Incumplida
Reserva tras cada una de 16 decisiones para pares de selectores sensibles e insensibles a la memoria. Desplaza en horizontal para inspeccionar.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Figura 1. Trayectorias ya redactadas. El par sensible difiere en la decisión de despeje y luego en la reserva. El par insensible tiene acciones y estados idénticos. El requisito rige solo en la decisión 15; una reserva de cinco en la decisión 0 no es compleción. Las líneas unen estados de decisión registrados y no denotan observaciones adicionales.

En la decisión 5, priority retiene las experiencias [1,4] y despeja; recency retiene [3,4] y descansa. Sus arreglos de memoria seleccionada contienen 2693 y 2692 bytes respectivamente, y los tamaños JSON de Petition capturados son 5039 y 5038 bytes. Unos techos de capacidad iguales no implican por tanto recuentos de bytes idénticos ni costos de tokens de LLM. Son bytes, no medidas de tokenizador. La fuente y la selección guardada establecen un cuello de dos registros en este límite; no establecen un cuello vinculante de 8192 bytes.

Los dos episodios sensibles terminan con reserva 5 y 0. Sus contrapartes literales dan las mismas trayectorias de reserva; sustituir el despeje por rest cambia el resultado diferido en el montaje redactado. Los dos episodios insensibles tienen secuencias idénticas de 16 pasos de acción/estado pese a memorias seleccionadas distintas. Es un control para la regla de decisión especificada, no un resultado general de que la memoria no pueda importar.

4. Lo que identifica la diferencia

La interpretación más respaldada es condicional: cambiar la política de selección cambia la información suministrada a esta regla sensible fija, su acción en la decisión 5 y el resultado posterior guardado. La dependencia está ingenierizada en la regla. El resultado no identifica una representación de memoria intrínsecamente superior ni un aprendizaje espontáneo.

Un detalle crítico es visible en el portador de recencia guardado. Sus bytes de memoria seleccionada en la decisión 5 incluyen la experiencia 3, una acción inspect cuya postobservación tiene reading: 1, la señal de obstrucción observada. El proveedor calcula una bandera a partir de tales postobservaciones, pero la rama de once decisiones restantes comprueba stalledCollect en su lugar. No usa esa bandera de obstrucción para disparar el despeje en este límite. En consecuencia, el brazo de recencia perdedor no puede describirse como carente de aviso potencialmente útil. Es una observación directa de fuente/registro; la proposición de que otra política explotaría la pista es una explicación alternativa plausible a probar, no un experimento nuevo realizado aquí. Portador de recencia guardado, regla sensible.

La comparación insensible también tiene una corrección retenida. Un control inicial esperaba distinta presencia/ausencia de stalled collects, pero ambos brazos retuvieron uno. El control corregido concernía experiencias retenidas distintas con trayectorias de mundo idénticas. Retener la expectativa fallida original evita que una historia de control equivocada se convierta en un resultado positivo. El registro aceptado del aparato documenta esa historia.

Ninguna condición de este conjunto aísla la necesidad del retraso o de la escasez al variarlas. El reporte describe un mecanismo que opera en su presencia. No afirma que el mismo contraste de selectores dependa de forma única de ninguno de los dos rasgos, ni que persista bajo fallos obsoletos, prerrequisitos cambiados, políticas distintas o mundos no examinados.

5. La verificación es ella misma un objeto de evidencia

La ejecución del proveedor y la reejecución estricta comparten una regla redactada. Su acuerdo puede establecer consistencia y a la vez perder una desviación compartida del contrato documentado. Una variante privada errónea conservada acortó la ventana final de recolección de cuatro decisiones a tres; la verificación estricta de esa copia aceptó el episodio, mientras que la decisión 12 devolvió inspect en lugar del collect esperado de forma independiente. La regla de producto original era correcta. La reserva de cuatro de la política cambiada no es un resultado adverso del selector.

Una prueba aditiva suministró luego doce expectativas literales que cubren las decisiones 11, 12 y 15, effort positivo/cero y memoria de stalled collect vacía/retenida. Los registros históricos anotan que el control no modificado pasa y que tres variantes erróneas compilables fallan las aserciones previstas. En esta toma de investigación, los ocho hashes de registro de implementación y el hash actual del archivo de prueba coincidieron con sus valores registrados, y se inspeccionaron los mensajes de elección fallida pertinentes. Son comprobaciones nuevas de integridad/lectura de evidencia histórica, no pruebas recién ejecutadas. Auditoría de aceptación, prueba literal, órdenes y registros grabados.

Las comprobaciones de bytes actuales también emparejaron los 140 archivos de episodio guardados con los siete recibos existentes y las 95 entradas archivadas de fuente/módulo con el manifiesto responsive-priority. Esto sostiene la integridad del paquete inspeccionado. No atestigua qué binario se ejecutó originalmente, no establece que toda entrada del compilador esté archivada ni sustituye una reproducción independiente reciente. El reporte conserva la limitación documentada de descubrimiento de fuente: el uso compilado exige el checkout de fuente en su ruta de construcción y una construcción sin -trimpath. Las afirmaciones de infraestructura completa, recuperación de fallos y corrección de todo el repositorio quedan fuera de este registro.

6. Evidencia de desarrollo anterior, aparte

El conjunto de datos más antiguo de preparación de artículo contiene ocho trayectorias redactadas, 128 momentos anidados y cuatro comparaciones de perfiles adaptive/baseline. Su métrica es la suma de la reserva llevada tras cada ProcessMoment en los momentos 0–15, medida en momentos-unidad de reserva. Las diferencias adaptive menos baseline son +4, 0, 0 y −1. No son la intervención priority/recency de arriba y no comparten su extremo terminal. Definiciones, cuatro comparaciones.

Cuatro diferencias de perfiles de desarrollo anteriores: current más cuatro, shifted cero, clustered cero, sparse menos uno. Desplaza en horizontal para inspeccionar.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Figura 2. Las cuatro comparaciones fijas de perfiles anteriores, con su métrica acumulada original. Se conservan los valores adversos y nulos. Esta figura es contexto de desarrollo aparte; no es muestreo adicional para la Figura 1.

En esa toma más antigua también se catalogan dos ensayos históricos de viabilidad de modelo local y dos filas de topología de aparato. Ninguno puede añadirse a las siete condiciones deterministas para ampliar una muestra de comportamiento. Las reejecuciones, reintentos, revaluaciones y las filas múltiples de una trayectoria conservan su linaje. Los perfiles más antiguos current, shifted, clustered y sparse ya se inspeccionaron y no pueden volverse una reserva ciega al renombrarlos.

7. Posición en la literatura

Los sistemas de memoria combinan intervenciones que deben distinguirse. Generative Agents combina factores de recuperación que incluyen recencia por acceso, importancia y relevancia; sus ablaciones de entrevista usan historias acumuladas por la arquitectura completa. Esa evaluación motiva separar sondas de decisión de historia común de intervenciones de trayectoria completa. No valida este resultado de cuenca. Park et al., 2023, §§4.1 and 6.1–6.2.

Reflexion cambia el contexto posterior mediante retroalimentación textual, no cambiando los pesos del modelo base. Su apéndice WebShop también informa un ajuste en el que la mejora intentada no se materializó. Tanto el mecanismo como esa limitación argumentan contra tratar la memoria o la reflexión como un beneficio incondicional. Conciernen tareas y estructuras de ensayo distintas de este aparato. Shinn et al., 2023, abstract and Appendix B.1.

Para un estudio empírico posterior, el tamaño muestral debe seguir un objetivo inferencial y supuestos justificados. La planificación basada en precisión, por ejemplo, exige una anchura de intervalo objetivo y una cuenta de la variabilidad; ningún artículo suministra un número suficiente universal de ejecuciones ORIGIN. Lakens, 2022, “Planning for Precision”.

La disponibilidad/funcionalidad de artefactos y los resultados obtenidos de forma independiente son logros separados en la terminología de artefactos de ACM. Este reporte ofrece una auditoría local de integridad y una derivación reproducible de figuras; no reclama una insignia de revisión ni una replicación experimental independiente. ACM SIGIR artifact criteria.

LongMemEval evalúa estrategias de lectura con evidencia recuperada por oráculo y muestra que el diseño del lector afecta el rendimiento de QA incluso cuando se suministran las sesiones de evidencia. Esto refuerza la distinción entre recuperación y uso, dentro de una tarea de QA de historial de chat. No mide la acción en un mundo persistente. Wu et al., v2, §5.5.

XENON acopla la memoria de experiencia a la corrección de dependencias y a la corrección de acciones candidatas. Es por tanto una referencia para una intervención distinta de cambiar la exposición de episodios manteniendo fijo el selector de este aparato. Lee et al., v3, §§4.1–4.2.

Vending-Bench separa los límites de contexto reciente de las herramientas de memoria externa sin restricciones explícitas de almacenamiento. Su ablación original de capacidad de contexto de GPT-4o-mini informa peores resultados con límites mayores. Esto advierte contra tratar cada capa de memoria como un solo presupuesto o asumir un beneficio monótono; su dominio de negocio y sus modelos históricos no son resultados ORIGIN. Backlund and Petersson, v1, §§2.1 and 3.5.2.

El análisis de RL de pocas ejecuciones de Agarwal y colegas concierne la variabilidad entre ejecuciones estocásticas de entrenamiento/evaluación. Sus recomendaciones estadísticas exigen una estructura de muestreo apropiada y no suministran intervalos de confianza para estas siete condiciones redactadas. Agarwal et al., NeurIPS 2021.

Los hallazgos humanos/no humanos y de cómputo/cuántica siguen siendo entradas de portafolio separadas, no evidencia del resultado presente. La adjudicación de fuentes registra el alcance admitido y las correcciones a resúmenes de recolección demasiado estrechos o incompletos.

8. Una continuación falseable

Una siguiente pregunta empírica podría preguntar si el contraste de selectores cambia la probabilidad de meta de episodio completo para una distribución declarada de modelo/tarea. La dirección debe permanecer abierta. Un resultado negativo útil retendría un registro de fallo pertinente sin mejorar la acción elegida ni el resultado terminal; un resultado dañino también informaría. La inspección de fuente presente motiva además a distinguir la retención del contrato de uso de pistas de la regla de decisión.

Antes de cualquier recolección, defínanse las observaciones elegibles, el almacenamiento accesible y la exposición por decisión, las reglas de selector/empate/desborde, las indicaciones entregadas, el modelo y la versión pedida/informada, los límites de recurso, la distribución de mundo/estado inicial, la reserva protegida, el plazo, las expectativas del puntuador independiente, el linaje de fallo/reintento, la regla de parada y el análisis primario. Ajústense los techos de recurso permitidos informando el consumo real. No se fuerce a que las trayectorias de mundo/observación posteriores a la intervención permanezcan iguales; esas diferencias pueden llevar el efecto estudiado.

Úsense episodios completos como unidades, con bloques o pares de tarea declarados. Los mundos compartidos con residentes que interactúan requieren unidades de grupo/mundo. Establézcase el denominador de todos los episodios lanzados y el trato de resultados no disponibles antes de mirar los resultados. Una semilla común no garantiza aleatoriedad de modelo correspondiente tras divergir las trayectorias. Elíjase un efecto significativo o un objetivo de precisión y evalúese la sensibilidad del tamaño muestral bajo supuestos defendibles; estas cantidades quedan sin fijar aquí. Es un estudio propuesto, no un preregistro ni un resultado empírico completado.

9. Reproducción y disponibilidad

La fuente subyacente y los registros de ejecución siguen siendo privados. Esta edición de lectura conserva las afirmaciones científicas y los valores registrados del borrador revisado internamente. Las referencias locales de fuente y auditoría en el texto nombran registros de ese paquete privado; no son enlaces públicos de artefactos.

Las dos figuras SVG se redibujan a partir de los valores de extracción y comparación aceptados para este sitio. Los valores de las figuras permiten inspeccionar los puntos trazados. Reconstruir una figura no es reejecutar el mundo. Estos valores derivados no sustituyen la fuente subyacente, los registros de episodio ni el puntuador independiente.

Una publicación de investigación pública sigue exigiendo autoría responsable, un paquete congelado de fuente/datos y redacción, enlaces estables de artefactos y revisión de ese paquete de publicación. Aquí no se han asignado ni publicado. La revisión interna completada cubre el manuscrito técnico y sus figuras; no es revisión por pares de revista ni ejecución independiente del aparato. Las correcciones siguen formando parte del registro de investigación.

Historial de revisiones

9 de septiembre de 2026. Edición de lectura web del borrador técnico revisado internamente. Se conservan las afirmaciones científicas y los valores registrados. Se omiten enlaces al sistema de archivos local; las dos figuras se redibujan a partir de los mismos valores registrados para una superficie de lectura oscura. Fuente y registros de ejecución siguen privados. No es una publicación pública de artefactos ni revisión por pares de revista. Las interfaces incluyen una traducción completa de esta edición de lectura; el texto inglés sigue siendo el original.

Resumo

Memória limitada pode mudar as ações futuras de um agente, mas guardar uma falha passada não estabelece aprendizagem nem garante que a informação será usada. Examinamos um aparato ORIGIN existente em que dois seletores determinísticos expõem experiências passadas distintas a uma regra de decisão fixa. Um residente age numa bacia redigida com recursos limitados por 16 decisões e deve terminar com pelo menos cinco unidades de reserva. Ambos os seletores permitem dois registros e no máximo 8192 bytes UTF-8 canônicos. O episódio arquivado responsive-priority alcança a obrigação; a contraparte de recência não. Dois controles que ignoram a memória selecionada seguem sequências idênticas de ação/estado e ambos falham a obrigação. A dependência decisiva está redigida de forma explícita: a recência retém um indício de obstrução observado, mas o ramo da decisão 5 da regra responde especificamente a um stalled collect lembrado. O relatório documenta portanto um mecanismo limitado e os limites de sua verificação. Não estima um efeito populacional nem demonstra aprendizagem de LLM, motivação, sobrevivência ou equivalência entre espécies. Preservamos comparações de desenvolvimento nulas/adversas em separado e especificamos o que um estudo empírico posterior precisaria.

Termos

ORIGIN
Nome próprio do projeto. Não se traduz.
Sol-III
Nome próprio do mundo de bacia redigido. Não se traduz.
obrigação adiada [delayed obligation]
Requisito pontuado só após a decisão 15: reserva final de pelo menos cinco. Ultrapassar cinco antes não é conclusão.
coleta estagnada [stalled collect]
Uma ação collect sem aumento visível de reserva, inclusive uma diminuição. Predicado do seletor; não nomeia uma causa oculta. Identificador de fonte: stalledCollect.
seletor [selector]
A política que escolhe quais registros arquivados um residente pode ver. Aqui: priority versus recency, cada um limitado a dois registros e 8192 bytes UTF-8.
aparato [apparatus]
O aparato determinístico já registrado: mundo, seletores, provedor, verificador e episódios salvos. Este relatório o lê; não o reexecuta.
residente [resident]
O agente que age na bacia. Não é um organismo biológico; reserva zero não é morte.
reserva [reserve]
O contador finito de recurso no mundo redigido. A obrigação adiada exige reserva final ≥ 5.

1. A pergunta e a evidência

A pergunta de pesquisa é se priorizar as experiências de ação falha observadas pelo próprio residente sobre as recentes, na mesma capacidade de memória, muda a conclusão de uma obrigação adiada — e sob quais condições lembrar essas experiências deixa o comportamento inalterado. A resposta presente limita-se a um aparato determinístico já concluído. É útil porque a informação selecionada, a ação dependente da regra, a mudança de mundo com autoridade e o desfecho podem ser examinados em separado.

O aparato foi concluído antes desta tomada de pesquisa. Este relatório lê a fonte, os registros aceitos, sete episódios salvos e a tabela de decisões derivada. Acrescenta uma auditoria de fonte/registro e figuras derivadas desses dados salvos. Não executa o mundo, um teste ou verificador Go, um modelo ao vivo nem um experimento de hardware. Quatro memorandos de pesquisa externos forneceram perguntas e fontes candidatas; as respostas não são evidência empírica. A tabela companheira de afirmações/fontes distingue achados originais, observações locais, hipóteses e pistas não verificadas.

«Falha» exige uma definição operacional. O predicado do seletor é uma ação collect seguida de nenhum aumento visível de reserva, inclusive uma diminuição. Não identifica uma explicação causal oculta nem afirma que a ação foi rejeitada. «Adiada» refere-se a consequências de ações anteriores que afetam a disponibilidade posterior de recurso e a uma obrigação avaliada só após a decisão 15. «Longo prazo» denota este horizonte finito; não significa implantação indefinida. Essas definições seguem o seletor implementado e o contrato do aparato.

2. O aparato concluído

A bacia Sol-III current existente é um mundo redigido e adimensional. A fonte define reserva inicial 4, effort 1, recurso armazenado 2 e uma obstrução. Reserva, effort e estoque têm tetos finitos. O residente escolhe entre inspect, collect, clear e rest. Desobstruir muda o estado do obstáculo e com isso a captura posterior de chuva. A percepção atual expõe reserva, effort e uma leitura de observação; não expõe diretamente cada variável do mundo. As declarações de recurso e ciclo de vida não transformam reserva zero em morte: residentes podem continuar agindo em zero. O extremo medido é portanto o abastecimento num prazo, não a sobrevivência. São descrições ao nível da fonte de world.go, não afirmações de realismo biológico.

Cada registro de memória vincula a percepção real pré-ação de um residente, a ação escolhida e a percepção pós-ação entregue a uma linhagem de episódio/execução. Só registros prévios completos são elegíveis. O seletor priority classifica primeiro collects com variação de reserva observada não positiva, depois preenche por recência. O comparador classifica só por recência. Ambos devolvem os registros selecionados em ordem cronológica, saltam candidatos excessivos e limitam todo o arranjo selecionado a dois registros e 8192 bytes. A seleção não atualiza pesos de modelo. O anfitrião retém o arquivo maior e a evidência de omissão; o orçamento de memória voltado ao residente aplica-se à exposição selecionada, não ao armazenamento total do computador.

Ambos braços sensíveis usam o mesmo provedor redigido sem estado. A regra tem um relógio explícito: na decisão 5, correspondente a onze decisões restantes incluindo a atual, desobstrui só se o effort visível for pelo menos três e a memória selecionada contiver um stalled collect. Descansa no intervalo médio e coleta com effort positivo nas quatro decisões finais. Outros ramos anteriores respondem à memória e à percepção atual. Assim o experimento não pede a um modelo que descubra uma estratégia. A fonte do provedor torna a dependência inspecionável.

Dois controles insensitive coletam quando o effort atual é positivo e caso contrário descansam, sem usar a memória selecionada. Três horários literais verificam um caminho bem-sucedido, esse caminho com a desobstrução da decisão 5 substituída por rest, e o comportamento de tudo rest. A meta adiada só se satisfaz quando um episódio completo e válido de 16 decisões tem reserva final de pelo menos cinco. Cruzar cinco antes não basta.

O verificador registrado reconstrói a correspondência entre manifestos, diários, tentativas, pedidos, memórias selecionadas, ações, observações e fatos finais antes de pontuar. É independente do provedor; o residente ainda usa um provedor redigido. Uma obrigação não cumprida válida distingue-se de evidência inválida ou incompleta. Essa distinção impede que uma falha de meta seja silenciosamente descartada como registro inválido e que um traço bem formado seja tomado por um desfecho bem-sucedido.

3. Resultados nas condições salvas

As sete condições registradas contêm 16 decisões cada. Suas 112 linhas de decisão são medições aninhadas, não 112 amostras independentes. Os valores seguintes foram lidos de resumos salvos de execução/verificação e conferidos com os estados finais extraídos correspondentes. São resultados descritivos de condição fixa, sem intervalo nem valor-p baseados em amostragem. Resultados salvos, extração de decisões.

CondiçãoReserva finalObrigação terminal
responsive-priority5Cumprida
responsive-recency0Não cumprida
insensitive-priority0Não cumprida
insensitive-recency0Não cumprida
literal-success-priority5Cumprida
literal-no-clear-priority0Não cumprida
literal-all-rest-priority0Não cumprida
Reserva após cada uma de 16 decisões para pares de seletores sensíveis e insensíveis à memória. Role na horizontal para inspecionar.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Figura 1. Trajetórias já redigidas. O par sensível difere na decisão de desobstrução e depois na reserva. O par insensível tem ações e estados idênticos. O requisito vale só na decisão 15; reserva cinco na decisão 0 não é conclusão. As linhas ligam estados de decisão registrados e não denotam observações adicionais.

Na decisão 5, priority retém as experiências [1,4] e desobstrui; recency retém [3,4] e descansa. Seus arranjos de memória selecionada contêm 2693 e 2692 bytes respectivamente, e os tamanhos JSON de Petition capturados são 5039 e 5038 bytes. Tetos de capacidade iguais portanto não implicam contagens de bytes idênticas nem custos de tokens de LLM. São bytes, não medidas de tokenizador. A fonte e a seleção salva estabelecem um gargalo de dois registros neste limite; não estabelecem um gargalo vinculante de 8192 bytes.

Os dois episódios sensíveis terminam com reserva 5 e 0. Suas contrapartes literais produzem as mesmas trajetórias de reserva; substituir a desobstrução por rest muda o desfecho adiado no aparato redigido. Os dois episódios insensíveis têm sequências idênticas de 16 passos de ação/estado apesar de memórias selecionadas diferentes. É um controle para a regra de decisão especificada, não um resultado geral de que a memória não possa importar.

4. O que a diferença identifica

A interpretação mais sustentada é condicional: mudar a política de seleção muda a informação fornecida a esta regra sensível fixa, sua ação na decisão 5 e o desfecho posterior salvo. A dependência está engenheirada na regra. O resultado não identifica uma representação de memória intrinsecamente superior nem uma aprendizagem espontânea.

Um detalhe crítico é visível no portador de recência salvo. Seus bytes de memória selecionada na decisão 5 incluem a experiência 3, uma ação inspect cuja pós-observação tem reading: 1, o sinal de obstrução observado. O provedor calcula uma bandeira a partir de tais pós-observações, mas o ramo de onze decisões restantes verifica stalledCollect em vez disso. Não usa essa bandeira de obstrução para disparar a desobstrução neste limite. Consequentemente, o braço de recência perdedor não pode ser descrito como sem aviso potencialmente útil. É uma observação direta de fonte/registro; a proposição de que outra política exploraria o indício é uma explicação alternativa plausível a testar, não um experimento novo realizado aqui. Portador de recência salvo, regra sensível.

A comparação insensível também tem uma correção retida. Um controle inicial esperava presença/ausência distinta de stalled collects, mas ambos os braços retiveram um. O controle corrigido dizia respeito a experiências retidas distintas com trajetórias de mundo idênticas. Reter a expectativa falha original impede que uma história de controle enganosa se converta em um resultado positivo. O registro aceito do aparato documenta essa história.

Nenhuma condição deste conjunto isola a necessidade do atraso ou da escassez ao variá-las. O relatório descreve um mecanismo que opera na presença delas. Não afirma que o mesmo contraste de seletores dependa de forma única de nenhum dos dois traços, nem que persista sob falhas obsoletas, pré-requisitos mudados, políticas diferentes ou mundos não examinados.

5. A verificação é ela mesma um objeto de evidência

A execução do provedor e a reprodução estrita compartilham uma regra redigida. O acordo pode estabelecer consistência e ainda assim perder um desvio compartilhado do contrato documentado. Uma variante privada errada preservada encurtou a janela final de coleta de quatro decisões para três; a verificação estrita dessa cópia aceitou o episódio, enquanto a decisão 12 devolveu inspect em vez do collect esperado de forma independente. A regra de produto original estava correta. A reserva quatro da política mudada não é um resultado adverso do seletor.

Um teste aditivo então forneceu doze expectativas literais abrangendo as decisões 11, 12 e 15, effort positivo/zero e memória de stalled collect vazia/retida. Os registros históricos anotam o controle não modificado passando e três variantes erradas compiláveis falhando as asserções previstas. Nesta tomada de pesquisa, todos os oito hashes de log de implementação e o hash atual do arquivo de teste coincidiram com os valores registrados, e as mensagens de escolha falha pertinentes foram inspecionadas. São checagens novas de integridade/leitura de evidência histórica, não testes recém-executados. Auditoria de aceitação, teste literal, comandos e registros gravados.

As checagens de bytes atuais também emparelharam os 140 arquivos de episódio salvos com os sete recibos existentes e as 95 entradas arquivadas de fonte/módulo com o manifesto responsive-priority. Isso sustenta a integridade do pacote inspecionado. Não atesta qual binário foi executado originalmente, não estabelece que toda entrada do compilador esteja arquivada nem substitui uma reprodução independente recente. O relatório preserva a limitação documentada de descoberta de fonte: o uso compilado exige o checkout de fonte em seu caminho de construção e uma construção sem -trimpath. Afirmações de infraestrutura completa, recuperação de falha e correção de todo o repositório permanecem fora deste registro.

6. Evidência de desenvolvimento anterior, em separado

O conjunto de dados mais antigo de prontidão de artigo contém oito trajetórias redigidas, 128 momentos aninhados e quatro comparações de perfis adaptive/baseline. A métrica é a soma da reserva carregada após cada ProcessMoment nos momentos 0–15, medida em momentos-unidade de reserva. As diferenças adaptive menos baseline são +4, 0, 0 e −1. Não são a intervenção priority/recency acima e não compartilham o extremo terminal. Definições, quatro comparações.

Quatro diferenças de perfis de desenvolvimento anteriores: current mais quatro, shifted zero, clustered zero, sparse menos um. Role na horizontal para inspecionar.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Figura 2. As quatro comparações fixas de perfis anteriores, com a métrica acumulada original. Os valores adversos e nulos são retidos. Esta figura é contexto de desenvolvimento separado; não é amostragem adicional para a Figura 1.

Nessa tomada mais antiga também se catalogam dois ensaios históricos de viabilidade de modelo local e duas linhas de topologia de aparato. Nenhum pode ser acrescentado às sete condições determinísticas para ampliar uma amostra comportamental. Reproduções, novas tentativas, reavaliações e várias linhas de uma trajetória retêm a linhagem. Os perfis mais antigos current, shifted, clustered e sparse já foram inspecionados e não podem tornar-se um holdout cego ao renomeá-los.

7. Posição na literatura

Sistemas de memória combinam intervenções que devem ser distinguidas. Generative Agents combina fatores de recuperação incluindo recência por acesso, importância e relevância; suas ablações de entrevista usam histórias acumuladas pela arquitetura completa. Essa avaliação motiva separar sondas de decisão de história comum de intervenções de trajetória completa. Não valida este resultado de bacia. Park et al., 2023, §§4.1 and 6.1–6.2.

Reflexion muda o contexto posterior por retroalimentação textual, sem mudar os pesos do modelo-base. Seu apêndice WebShop também relata um ajuste em que a melhoria tentada não se materializou. Tanto o mecanismo quanto essa limitação argumentam contra tratar memória ou reflexão como benefício incondicional. Dizem respeito a tarefas e estruturas de ensaio distintas deste aparato. Shinn et al., 2023, abstract and Appendix B.1.

Para um estudo empírico posterior, o tamanho amostral deve seguir um objetivo inferencial e premissas justificadas. O planejamento baseado em precisão, por exemplo, exige uma largura de intervalo-alvo e uma conta da variabilidade; nenhum artigo fornece um número suficiente universal de execuções ORIGIN. Lakens, 2022, “Planning for Precision”.

Disponibilidade/funcionalidade de artefatos e resultados obtidos independentemente são conquistas separadas na terminologia de artefatos da ACM. Este relatório oferece uma auditoria local de integridade e uma derivação reproduzível de figuras; não reivindica um selo de revisão nem uma replicação experimental independente. ACM SIGIR artifact criteria.

LongMemEval avalia estratégias de leitura com evidência recuperada por oráculo e mostra que o desenho do leitor afeta o desempenho de QA mesmo quando as sessões de evidência são fornecidas. Isso fortalece a distinção entre recuperação e uso, numa tarefa de QA de histórico de chat. Não mede ação em mundo persistente. Wu et al., v2, §5.5.

XENON acopla a memória de experiência à correção de dependências e à correção de ações candidatas. É portanto uma referência para uma intervenção distinta de mudar a exposição de episódios mantendo fixo o seletor deste aparato. Lee et al., v3, §§4.1–4.2.

Vending-Bench separa limites de contexto recente de ferramentas de memória externa sem restrições explícitas de armazenamento. Sua ablação original de capacidade de contexto do GPT-4o-mini relata piores desfechos com limites maiores. Isso adverte contra tratar cada camada de memória como um só orçamento ou assumir benefício monotônico; seu domínio de negócios e modelos históricos não são resultados ORIGIN. Backlund and Petersson, v1, §§2.1 and 3.5.2.

A análise de RL de poucas execuções de Agarwal e colegas concerne a variabilidade entre execuções estocásticas de treino/avaliação. Suas recomendações estatísticas exigem uma estrutura amostral apropriada e não fornecem intervalos de confiança para estas sete condições redigidas. Agarwal et al., NeurIPS 2021.

Achados humanos/não humanos e de computação/quântica permanecem entradas de portfólio separadas, não evidência do resultado presente. A adjudicação de fontes registra o alcance admitido e correções a resumos de coleta estreitos demais ou incompletos.

8. Uma continuação falseável

Uma próxima pergunta empírica poderia perguntar se o contraste de seletores muda a probabilidade de meta de episódio completo para uma distribuição declarada de modelo/tarefa. A direção deve permanecer aberta. Um resultado negativo útil reteria um registro de falha pertinente sem melhorar a ação escolhida nem o desfecho terminal; um resultado prejudicial também informaria. A inspeção de fonte presente motiva ainda a distinguir a retenção do contrato de uso de indícios da regra de decisão.

Antes de qualquer coleta, definam-se as observações elegíveis, o armazenamento acessível e a exposição por decisão, as regras de seletor/empate/estouro, os prompts entregues, o modelo e a versão pedida/relatada, os limites de recurso, a distribuição de mundo/estado inicial, o holdout protegido, o prazo, as expectativas do pontuador independente, a linhagem de falha/nova tentativa, a regra de parada e a análise primária. Igualem-se os tetos de recurso permitidos relatando o consumo real. Não se force que as trajetórias de mundo/observação pós-intervenção permaneçam iguais; essas diferenças podem carregar o efeito estudado.

Usem-se episódios completos como unidades, com blocos ou pares de tarefa declarados. Mundos compartilhados com residentes que interagem exigem unidades de grupo/mundo. Declare-se o denominador de todos os episódios lançados e o tratamento de desfechos indisponíveis antes de olhar os resultados. Uma semente comum não garante aleatoriedade de modelo correspondente depois que as trajetórias divergem. Escolha-se um efeito significativo ou um alvo de precisão e avalie-se a sensibilidade do tamanho amostral sob premissas defensáveis; essas quantidades permanecem indefinidas aqui. É um estudo proposto, não um pré-registro nem um resultado empírico concluído.

9. Reprodução e disponibilidade

A fonte subjacente e os registros de execução permanecem privados. Esta edição de leitura preserva as afirmações científicas e os valores registrados do rascunho revisado internamente. As referências locais de fonte e auditoria no texto nomeiam registros daquele pacote privado; não são ligações públicas de artefatos.

As duas figuras SVG são redesenhadas a partir dos valores de extração e comparação aceitos para este sítio. Os valores das figuras permitem inspecionar os pontos traçados. Reconstruir uma figura é diferente de reproduzir o mundo. Esses valores derivados não substituem a fonte subjacente, os registros de episódio nem o pontuador independente.

Uma publicação de pesquisa pública ainda exige autoria responsável, um pacote congelado de fonte/dados e redação, ligações estáveis de artefatos e revisão desse pacote de publicação. Aqui não foram atribuídos nem publicados. A revisão interna concluída cobre o manuscrito técnico e suas figuras; não é revisão por pares de periódico nem execução independente do aparato. Correções permanecem parte do registro de pesquisa.

Histórico de revisões

9 de setembro de 2026. Edição de leitura na web do rascunho técnico revisado internamente. As afirmações científicas e os valores registrados são retidos. Ligações ao sistema de arquivos local são omitidas; as duas figuras são redesenhadas a partir dos mesmos valores registrados para uma superfície de leitura escura. Fonte e registros de execução permanecem privados. Não é uma publicação pública de artefatos nem revisão por pares de periódico. As interfaces incluem uma tradução completa desta edição de leitura; o texto inglês permanece o original.

Résumé

Une mémoire limitée peut changer les actions futures d’un agent, mais stocker un échec passé n’établit pas un apprentissage et ne garantit pas que l’information sera utilisée. Nous examinons un appareil ORIGIN existant dans lequel deux sélecteurs déterministes exposent des expériences passées différentes à une règle de décision fixe. Un résident agit dans un bassin rédigé à ressources contraintes pendant 16 décisions et doit terminer avec au moins cinq unités de réserve. Les deux sélecteurs autorisent deux enregistrements et au plus 8192 octets UTF-8 canoniques. L’épisode archivé responsive-priority atteint l’obligation ; son pendant de récence ne l’atteint pas. Deux témoins qui ignorent la mémoire sélectionnée suivent des séquences action/état identiques et manquent tous deux l’obligation. La dépendance décisive est rédigée explicitement : la récence retient un indice d’obstruction observé, mais la branche de la décision 5 de la règle répond spécifiquement à un stalled collect mémorisé. Le rapport documente donc un mécanisme borné et les limites de sa vérification. Il n’estime pas un effet de population et ne démontre pas un apprentissage de LLM, une motivation, une survie ou une équivalence interspécifique. Nous conservons des comparaisons de développement nulles/adverses distinctes et précisons ce dont une étude empirique ultérieure aurait besoin.

Termes

ORIGIN
Nom propre du projet. Non traduit.
Sol-III
Nom propre du monde de bassin rédigé. Non traduit.
obligation différée [delayed obligation]
Exigence notée seulement après la décision 15 : réserve finale d’au moins cinq. Dépasser cinq plus tôt n’est pas un achèvement.
collecte bloquée [stalled collect]
Une action collect sans hausse visible de la réserve, y compris une baisse. Prédicat du sélecteur ; il ne nomme pas une cause cachée. Identifiant source : stalledCollect.
sélecteur [selector]
La politique qui choisit quels enregistrements archivés un résident peut voir. Ici : priority contre recency, chacun plafonné à deux enregistrements et 8192 octets UTF-8.
appareil [apparatus]
Le dispositif déterministe déjà consigné : monde, sélecteurs, fournisseur, vérificateur et épisodes enregistrés. Ce rapport le lit ; il ne le relance pas.
résident [resident]
L’agent qui agit dans le bassin. Ce n’est pas un organisme biologique ; une réserve nulle n’est pas la mort.
réserve [reserve]
Le compteur de ressource fini dans le monde rédigé. L’obligation différée exige une réserve finale ≥ 5.

1. La question et les preuves

La question de recherche est de savoir si, à capacité de mémoire égale, prioriser les expériences d’action échouée observées par le résident lui-même par rapport aux expériences récentes change l’achèvement d’une obligation différée — et dans quelles conditions se souvenir de ces expériences laisse le comportement inchangé. La réponse actuelle se limite à un appareil déterministe déjà achevé. Elle est utile parce que l’information sélectionnée, l’action dépendante de la règle, le changement de monde autoritatif et le résultat peuvent être examinés séparément.

L’appareil a été achevé avant cette prise de recherche. Ce rapport lit sa source, les enregistrements acceptés, sept épisodes sauvegardés et la table de décisions dérivée. Il ajoute un audit source/enregistrement et des figures dérivées de ces données sauvegardées. Il n’exécute ni le monde, ni un test ou vérificateur Go, ni un modèle vivant, ni une expérience matérielle. Quatre notes de recherche externes ont fourni des questions et des sources candidates ; leurs réponses ne sont pas des preuves empiriques. La table compagnon des assertions/sources distingue constatations originales, observations locales, hypothèses et pistes non vérifiées.

« Échec » exige une définition opérationnelle. Le prédicat du sélecteur est une action collect suivie d’aucune hausse visible de la réserve, y compris une baisse. Il n’identifie pas une explication causale cachée et n’affirme pas que l’action a été rejetée. « Différée » désigne les conséquences d’actions antérieures qui affectent la disponibilité ultérieure de la ressource, et une obligation évaluée seulement après la décision 15. « Long terme » désigne cet horizon fini ; ce n’est pas un déploiement indéfini. Ces définitions suivent le sélecteur implémenté et le contrat de l’appareil.

2. L’appareil achevé

Le bassin Sol-III current existant est un monde rédigé, sans dimension. Sa source définit une réserve initiale 4, effort 1, une ressource stockée 2 et une obstruction. Réserve, effort et stock ont des plafonds finis. Le résident choisit parmi inspect, collect, clear et rest. Dégager change l’état de l’obstacle et donc la capture ultérieure de pluie. La perception actuelle expose réserve, effort et une lecture d’observation ; elle n’expose pas directement chaque variable du monde. Les déclarations de ressource et de cycle de vie ne transforment pas une réserve nulle en mort : les résidents peuvent continuer d’agir à zéro. L’extrémité mesurée est donc l’approvisionnement à une échéance, non la survie. Ce sont des descriptions au niveau source de world.go, non des prétentions de réalisme biologique.

Chaque enregistrement de mémoire lie la perception réelle pré-action d’un résident, l’action choisie et la perception post-action livrée à une lignée d’épisode/exécution. Seuls les enregistrements antérieurs complets sont éligibles. Le sélecteur priority classe d’abord les collect dont le changement de réserve observé n’est pas positif, puis complète par récence. Le comparateur classe par récence seule. Tous deux renvoient les enregistrements sélectionnés chronologiquement, sautent les candidats trop grands et plafonnent tout le tableau sélectionné à deux enregistrements et 8192 octets. La sélection ne met pas à jour les poids d’un modèle. L’hôte conserve la plus grande archive et les preuves d’omission ; le budget de mémoire côté résident s’applique à l’exposition sélectionnée, non au stockage total de l’ordinateur.

Les deux bras sensibles utilisent le même fournisseur rédigé sans état. Sa règle a une horloge explicite : à la décision 5, correspondant à onze décisions restantes y compris la courante, il dégage seulement si l’effort visible est d’au moins trois et si la mémoire sélectionnée contient un stalled collect. Il se repose dans l’intervalle médian et collecte avec un effort positif pendant les quatre dernières décisions. D’autres branches plus tôt répondent à la mémoire et à la perception actuelle. L’expérience ne demande donc pas à un modèle de découvrir une stratégie. La source du fournisseur rend la dépendance inspectable.

Deux témoins insensitive collectent lorsque l’effort courant est positif et sinon se reposent, sans utiliser la mémoire sélectionnée. Trois calendriers littéraux vérifient une voie réussie, cette voie avec le dégagement de la décision 5 remplacé par rest, et un comportement tout rest. Le but différé n’est satisfait que lorsqu’un épisode complet et valide de 16 décisions a une réserve finale d’au moins cinq. Franchir cinq plus tôt ne suffit pas.

Le vérificateur enregistré reconstitue la correspondance entre manifeste, journaux, tentatives, requêtes, mémoires sélectionnées, actions, observations et faits finaux avant de noter. Il est indépendant du fournisseur ; le résident lui-même utilise encore un fournisseur rédigé. Une obligation manquée valide est distincte d’une preuve invalide ou incomplète. Cette distinction empêche qu’un échec de but soit silencieusement écarté comme enregistrement invalide et qu’une trace bien formée soit prise pour un résultat réussi.

3. Résultats dans les conditions sauvegardées

Les sept conditions enregistrées contiennent chacune 16 décisions. Leurs 112 lignes de décision sont des mesures emboîtées, non 112 échantillons indépendants. Les valeurs suivantes ont été lues dans des résumés d’exécution/vérification sauvegardés et confrontées aux états finaux extraits correspondants. Ce sont des résultats descriptifs à condition fixe, sans intervalle ni valeur p fondés sur un échantillonnage. Résultats sauvegardés, extraction des décisions.

ConditionRéserve finaleObligation terminale
responsive-priority5Atteinte
responsive-recency0Manquée
insensitive-priority0Manquée
insensitive-recency0Manquée
literal-success-priority5Atteinte
literal-no-clear-priority0Manquée
literal-all-rest-priority0Manquée
Réserve après chacune des 16 décisions pour les paires de sélecteurs sensibles et insensibles à la mémoire. Faites défiler horizontalement pour inspecter.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Figure 1. Trajectoires déjà rédigées. La paire sensible diffère à la décision de dégagement, puis dans la réserve. La paire insensible a des actions et des états identiques. L’exigence ne s’applique qu’à la décision 15 ; une réserve de cinq à la décision 0 n’est pas un achèvement. Les lignes relient des états de décision enregistrés et ne dénotent pas d’observations supplémentaires.

À la décision 5, priority retient les expériences [1,4] et dégage ; recency retient [3,4] et se repose. Leurs tableaux de mémoire sélectionnée contiennent respectivement 2693 et 2692 octets, et les tailles JSON de Petition capturées sont 5039 et 5038 octets. Des plafonds de capacité égaux n’impliquent donc pas des comptes d’octets identiques ni des coûts de jetons de LLM. Ce sont des octets, non des mesures de tokéniseur. La source et la sélection sauvegardée établissent un goulot de deux enregistrements à cette limite ; elles n’établissent pas un goulot contraignant de 8192 octets.

Les deux épisodes sensibles se terminent avec une réserve 5 et 0. Leurs pendants littéraux donnent les mêmes trajectoires de réserve ; remplacer le dégagement par rest change le résultat différé dans le dispositif rédigé. Les deux épisodes insensibles ont des séquences action/état identiques sur 16 pas malgré des mémoires sélectionnées différentes. C’est un témoin pour la règle de décision spécifiée, non un résultat général selon lequel la mémoire ne pourrait pas compter.

4. Ce que la différence identifie

L’interprétation la plus étayée est conditionnelle : changer la politique de sélection change l’information fournie à cette règle sensible fixe, son action à la décision 5 et le résultat aval sauvegardé. La dépendance est conçue dans la règle. Le résultat n’identifie pas une représentation de mémoire intrinsèquement supérieure ni un apprentissage spontané.

Un détail critique est visible dans le porteur de récence sauvegardé. Ses octets de mémoire sélectionnée à la décision 5 incluent l’expérience 3, une action inspect dont la post-observation a reading: 1, le signal d’obstruction observé. Le fournisseur calcule un drapeau à partir de telles post-observations, mais la branche des onze décisions restantes vérifie stalledCollect à la place. Il n’utilise pas ce drapeau d’obstruction pour déclencher le dégagement à cette limite. Par conséquent, le bras de récence perdant ne peut pas être décrit comme dépourvu d’avertissement potentiellement utile. C’est une observation directe source/enregistrement ; la proposition qu’une autre politique exploiterait l’indice est une explication alternative plausible à tester, non une expérience nouvelle menée ici. Porteur de récence sauvegardé, règle sensible.

La comparaison insensible a aussi une correction retenue. Un témoin initial attendait une présence/absence différente de stalled collects, mais les deux bras en ont retenu un. Le témoin corrigé concernait des expériences retenues différentes avec des trajectoires de monde identiques. Conserver l’attente initiale échouée empêche qu’une histoire de témoin erronée soit convertie en un résultat positif. L’enregistrement accepté de l’appareil documente cette histoire.

Aucune condition de cet ensemble n’isole la nécessité du délai ou de la rareté en les faisant varier. Le rapport décrit un mécanisme opérant en leur présence. Il n’affirme pas que le même contraste de sélecteurs dépende uniquement de l’une ou l’autre caractéristique, ni qu’il persiste sous des échecs obsolètes, des prérequis changés, des politiques différentes ou des mondes non examinés.

5. La vérification est elle-même un objet de preuve

L’exécution du fournisseur et la relecture stricte partagent une règle rédigée. Leur accord peut établir une cohérence tout en manquant un écart partagé par rapport au contrat documenté. Une variante privée fautive conservée a raccourci la fenêtre finale de collecte de quatre décisions à trois ; la vérification stricte de cette copie a accepté l’épisode, tandis que la décision 12 a renvoyé inspect plutôt que le collect attendu indépendamment. La règle produit d’origine était correcte. La réserve de quatre de la politique changée n’est pas un résultat adverse du sélecteur.

Un test additif a ensuite fourni douze attentes littérales couvrant les décisions 11, 12 et 15, l’effort positif/nul et une mémoire stalled collect vide/retenue. Les journaux historiques enregistrent le témoin non modifié qui passe et trois variantes fautives compilables qui échouent aux assertions prévues. Dans cette prise de recherche, les huit hachages de journal d’implémentation et le hachage actuel du fichier de test ont concordé avec leurs valeurs enregistrées, et les messages de choix échoué pertinents ont été inspectés. Ce sont des contrôles neufs d’intégrité/lecture de preuves historiques, non des tests fraîchement exécutés. Audit d’acceptation, test littéral, commandes et journaux enregistrés.

Les contrôles d’octets actuels ont aussi apparié les 140 fichiers d’épisode sauvegardés aux sept reçus existants et les 95 entrées archivées source/module au manifeste responsive-priority. Cela étaye l’intégrité du paquet inspecté. Cela n’atteste pas quel binaire s’est exécuté à l’origine, n’établit pas que toute entrée de compilateur est archivée et ne remplace pas une reproduction indépendante fraîche. Le rapport conserve la limitation documentée de découverte de source : l’usage compilé exige le checkout source à son chemin de construction et une construction sans -trimpath. Les prétentions d’infrastructure complète, de reprise sur incident et de correction à l’échelle du dépôt restent hors de cet enregistrement.

6. Preuves de développement antérieur, distinctes

Le jeu de données plus ancien de préparation d’article contient huit trajectoires rédigées, 128 moments emboîtés et quatre comparaisons de profils adaptive/baseline. Sa métrique est la somme de la réserve portée après chaque ProcessMoment sur les moments 0–15, mesurée en moments-unités de réserve. Les différences adaptive moins baseline sont +4, 0, 0 et −1. Ce n’est pas l’intervention priority/recency ci-dessus, et elles n’en partagent pas l’extrémité terminale. Définitions, quatre comparaisons.

Quatre différences de profils de développement antérieurs : current plus quatre, shifted zéro, clustered zéro, sparse moins un. Faites défiler horizontalement pour inspecter.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Figure 2. Les quatre comparaisons de profils fixes antérieures, avec leur métrique cumulative d’origine. Les valeurs adverses et nulles sont conservées. Cette figure est un contexte de développement distinct ; ce n’est pas un échantillonnage supplémentaire pour la Figure 1.

Deux essais historiques de faisabilité de modèle local et deux lignes de topologie d’appareil sont aussi catalogués dans cette prise plus ancienne. Aucun ne peut s’ajouter aux sept conditions déterministes pour agrandir un échantillon comportemental. Relectures, nouvelles tentatives, re-notations et lignes multiples d’une trajectoire conservent leur lignée. Les profils plus anciens current, shifted, clustered et sparse ont déjà été inspectés et ne peuvent devenir une réserve aveugle par simple renommage.

7. Position dans la littérature

Les systèmes de mémoire combinent des interventions qu’il faut distinguer. Generative Agents combine des facteurs de récupération dont la récence d’accès, l’importance et la pertinence ; ses ablations d’entretien utilisent des historiques accumulés par l’architecture entière. Cette évaluation motive à séparer des sondes de décision à histoire commune des interventions de trajectoire complète. Elle ne valide pas ce résultat de bassin. Park et al., 2023, §§4.1 and 6.1–6.2.

Reflexion change le contexte ultérieur par rétroaction textuelle plutôt qu’en changeant les poids du modèle de base. Son annexe WebShop rapporte aussi un cadre où l’amélioration tentée ne s’est pas matérialisée. Le mécanisme et cette limite plaident contre le traitement de la mémoire ou de la réflexion comme un bénéfice inconditionnel. Ils concernent des tâches et des structures d’essai différentes de cet appareil. Shinn et al., 2023, abstract and Appendix B.1.

Pour une étude empirique ultérieure, la taille d’échantillon doit suivre un objectif inférentiel et des hypothèses justifiées. Une planification fondée sur la précision, par exemple, exige une largeur d’intervalle cible et un compte de la variabilité ; aucun article ne fournit un nombre suffisant universel de runs ORIGIN. Lakens, 2022, “Planning for Precision”.

La disponibilité/fonctionnalité d’artefacts et les résultats obtenus indépendamment sont des accomplissements distincts dans la terminologie d’artefacts de l’ACM. Ce rapport offre un audit d’intégrité local et une dérivation reproductible de figures ; il ne revendique ni un badge d’examen ni une réplication expérimentale indépendante. ACM SIGIR artifact criteria.

LongMemEval évalue des stratégies de lecture avec des preuves récupérées par oracle et montre que la conception du lecteur affecte la performance QA même lorsque les séances de preuve sont fournies. Cela renforce la distinction entre récupération et usage, dans une tâche QA d’historique de chat. Cela ne mesure pas l’action en monde persistant. Wu et al., v2, §5.5.

XENON couple la mémoire d’expérience à la correction de dépendances et à la correction d’actions candidates. C’est donc une référence pour une intervention différente du changement d’exposition d’épisode en gardant fixe le sélecteur de cet appareil. Lee et al., v3, §§4.1–4.2.

Vending-Bench sépare les limites de contexte récent des outils de mémoire externe sans contraintes de stockage explicites. Son ablation originale de capacité de contexte GPT-4o-mini rapporte de moins bons résultats avec des limites plus grandes. Cela met en garde contre le traitement de chaque couche de mémoire comme un seul budget ou l’hypothèse d’un bénéfice monotone ; son domaine d’affaires et ses modèles historiques ne sont pas des résultats ORIGIN. Backlund and Petersson, v1, §§2.1 and 3.5.2.

L’analyse RL à peu de runs d’Agarwal et collègues concerne la variabilité entre exécutions stochastiques d’entraînement/évaluation. Ses recommandations statistiques exigent une structure d’échantillonnage appropriée et ne fournissent pas d’intervalles de confiance pour ces sept conditions rédigées. Agarwal et al., NeurIPS 2021.

Les constatations humaines/non humaines et calcul/quantique restent des entrées de portefeuille distinctes, non des preuves du résultat présent. L’adjudication des sources consigne la portée admise et les corrections d’abrégés de collecte trop étroits ou incomplets.

8. Une suite falsifiable

Une question empirique suivante pourrait demander si le contraste de sélecteurs change la probabilité de but d’épisode complet pour une distribution déclarée de modèle/tâche. La direction doit rester ouverte. Un résultat négatif utile retiendrait un enregistrement d’échec pertinent sans améliorer l’action choisie ni le résultat terminal ; un résultat nuisible serait aussi informatif. L’inspection de source actuelle motive en outre à distinguer la rétention du contrat d’usage d’indices de la règle de décision.

Avant toute collecte, définir les observations éligibles, le stockage accessible et l’exposition par décision, les règles de sélecteur/égalité/débordement, les invites livrées, le modèle et la version demandée/rapportée, les limites de ressource, la distribution monde/état initial, la réserve protégée, l’échéance, les attentes du noteur indépendant, la lignée échec/nouvelle tentative, la règle d’arrêt et l’analyse primaire. Faire correspondre les plafonds de ressource permis tout en rapportant la consommation réelle. Ne pas forcer les trajectoires monde/observation post-intervention à rester égales ; ces différences peuvent porter l’effet étudié.

Utiliser des épisodes complets comme unités, avec des blocs ou paires de tâches déclarés. Les mondes partagés avec des résidents en interaction exigent des unités groupe/monde. Énoncer le dénominateur de tous les épisodes lancés et le traitement des résultats indisponibles avant de regarder les résultats. Une graine commune ne garantit pas une aléatoire de modèle correspondante après divergence des trajectoires. Choisir un effet significatif ou une cible de précision et évaluer la sensibilité de la taille d’échantillon sous des hypothèses défendables ; ces quantités restent non fixées ici. C’est une étude proposée, non un préenregistrement ni un résultat empirique achevé.

9. Reproduction et disponibilité

La source sous-jacente et les enregistrements d’exécution restent privés. Cette édition de lecture conserve les assertions scientifiques et les valeurs enregistrées du brouillon examiné en interne. Les références locales de source et d’audit dans le texte nomment des enregistrements de ce paquet privé ; ce ne sont pas des liens publics d’artefacts.

Les deux figures SVG sont redessinées à partir des valeurs d’extraction et de comparaison acceptées pour ce site. Les valeurs des figures permettent d’inspecter les points tracés. Reconstruire une figure n’est pas relire le monde. Ces valeurs dérivées ne remplacent pas la source sous-jacente, les enregistrements d’épisode ni le noteur indépendant.

Une publication de recherche publique exige encore une paternité responsable, un paquet figé source/données et caviardage, des liens d’artefacts stables et un examen de ce paquet de publication. Ils n’ont pas été attribués ni publiés ici. L’examen interne achevé couvre le manuscrit technique et ses figures ; ce n’est ni une relecture par les pairs d’une revue ni une exécution indépendante de l’appareil. Les corrections restent partie de l’enregistrement de recherche.

Historique des révisions

9 septembre 2026. Édition de lecture web du brouillon technique examiné en interne. Les assertions scientifiques et les valeurs enregistrées sont conservées. Les liens vers le système de fichiers local sont omis ; les deux figures sont redessinées à partir des mêmes valeurs enregistrées pour une surface de lecture sombre. Source et enregistrements d’exécution restent privés. Ce n’est ni une publication publique d’artefacts ni une relecture par les pairs d’une revue. Les interfaces incluent une traduction complète de cette édition de lecture ; le texte anglais demeure l’original.

Kurzfassung

Begrenztes Gedächtnis kann künftige Handlungen eines Agenten ändern, aber das Speichern eines vergangenen Fehlers begründet kein Lernen und garantiert nicht, dass die Information genutzt wird. Wir prüfen einen bestehenden ORIGIN-Versuchsaufbau, in dem zwei deterministische Selektoren einer festen Entscheidungsregel unterschiedliche vergangene Erfahrungen zeigen. Ein Bewohner handelt in einem verfassten ressourcenbeschränkten Einzugsgebiet über 16 Entscheidungen und muss mit mindestens fünf Reserveeinheiten enden. Beide Selektoren erlauben zwei Datensätze und höchstens 8192 kanonische UTF-8-Bytes. Die archivierte Episode responsive-priority erreicht die Verpflichtung; das Recency-Gegenstück nicht. Zwei Kontrollen, die die ausgewählte Erinnerung ignorieren, folgen identischen Handlungs-/Zustandsfolgen und verfehlen beide die Verpflichtung. Die entscheidende Abhängigkeit ist ausdrücklich verfasst: Recency behält einen beobachteten Hindernisreiz, aber der Entscheidungs-5-Zweig der Regel reagiert eigens auf ein erinnertes stalled collect. Der Bericht dokumentiert daher einen begrenzten Mechanismus und die Grenzen seiner Prüfung. Er schätzt keinen Populationseffekt und zeigt kein LLM-Lernen, keine Motivation, kein Überleben und keine Artengleichheit. Getrennte Null-/Ungünstige-Entwicklungsvergleiche bleiben erhalten; wir geben an, was eine spätere empirische Studie bräuchte.

Begriffe

ORIGIN
Eigenname des Projekts. Wird nicht übersetzt.
Sol-III
Eigenname der verfassten Einzugsgebietswelt. Wird nicht übersetzt.
verzögerte Verpflichtung [delayed obligation]
Anforderung, die erst nach Entscheidung 15 bewertet wird: endgültige Reserve mindestens fünf. Ein früheres Überschreiten von fünf ist keine Erfüllung.
stockende Sammlung [stalled collect]
Eine collect-Handlung ohne sichtbare Reservezunahme, einschließlich einer Abnahme. Prädikat des Selektors; benennt keine verborgene Ursache. Quellkennung: stalledCollect.
Selektor [selector]
Die Richtlinie, die wählt, welche archivierten Datensätze ein Bewohner sehen darf. Hier: priority gegen recency, jeweils begrenzt auf zwei Datensätze und 8192 UTF-8-Bytes.
Versuchsaufbau [apparatus]
Die bereits aufgezeichnete deterministische Anordnung: Welt, Selektoren, Anbieter, Prüfer und gespeicherte Episoden. Dieser Bericht liest sie; er führt sie nicht erneut aus.
Bewohner [resident]
Der handelnde Agent im Einzugsgebiet. Kein biologischer Organismus; Reserve null ist nicht Tod.
Reserve [reserve]
Der endliche Ressourcenzähler in der verfassten Welt. Die verzögerte Verpflichtung verlangt endgültige Reserve ≥ 5.

1. Die Frage und die Evidenz

Die Forschungsfrage ist, ob die Priorisierung selbst beobachteter Fehlhandlungs-Erfahrungen eines Bewohners gegenüber rezenten Erfahrungen bei gleicher Gedächtniskapazität die Erfüllung einer verzögerten Verpflichtung ändert — und unter welchen Bedingungen das Erinnern dieser Erfahrungen das Verhalten unverändert lässt. Die gegenwärtige Antwort beschränkt sich auf einen bereits abgeschlossenen deterministischen Versuchsaufbau. Sie ist nützlich, weil ausgewählte Information, regelabhängige Handlung, autoritative Weltänderung und Ergebnis getrennt geprüft werden können.

Der Versuchsaufbau war vor dieser Forschungsaufnahme abgeschlossen. Dieser Bericht liest Quelle, angenommene Aufzeichnungen, sieben gespeicherte Episoden und die abgeleitete Entscheidungstabelle. Er fügt eine Quellen-/Aufzeichnungsprüfung und aus diesen gespeicherten Daten abgeleitete Abbildungen hinzu. Er führt weder die Welt noch einen Go-Test oder -Prüfer, ein lebendes Modell oder ein Hardware-Experiment aus. Vier externe Forschungsnotizen lieferten Kandidatenfragen und Quellen; ihre Antworten sind keine empirische Evidenz. Die begleitende Anspruchs-/Quellentabelle unterscheidet originale Befunde, lokale Beobachtungen, Hypothesen und unprüfte Hinweise.

„Fehler“ braucht eine operationale Definition. Das Prädikat des Selektors ist eine collect-Handlung ohne sichtbare Reservezunahme, einschließlich einer Abnahme. Es benennt keine verborgene Kausalerklärung und behauptet nicht, die Handlung sei zurückgewiesen worden. „Verzögert“ meint Folgen früherer Handlungen für spätere Ressourcenverfügbarkeit und eine Verpflichtung, die erst nach Entscheidung 15 bewertet wird. „Langfristig“ bezeichnet diesen endlichen Horizont; es meint keine unbefristete Bereitstellung. Diese Definitionen folgen dem implementierten Selektor und dem Vertrag des Versuchsaufbaus.

2. Der abgeschlossene Versuchsaufbau

Das bestehende Sol-III-current-Einzugsgebiet ist eine verfasste, dimensionslose Welt. Die Quelle setzt Anfangsreserve 4, effort 1, gespeicherte Ressource 2 und ein Hindernis. Reserve, effort und Speicher haben endliche Deckel. Der Bewohner wählt unter inspect, collect, clear und rest. Räumen ändert den Hinderniszustand und damit spätere Regenaufnahme. Die gegenwärtige Wahrnehmung zeigt Reserve, effort und eine Beobachtungsablesung; sie zeigt nicht jede Weltvariable direkt. Ressourcen- und Lebenszyklusdeklarationen machen Reserve null nicht zum Tod: Bewohner können bei null weiterhandeln. Der gemessene Endpunkt ist daher Versorgung zu einer Frist, nicht Überleben. Das sind Beschreibungen auf Quellebene von world.go, keine Ansprüche biologischer Realistik.

Jeder Gedächtnisdatensatz bindet die tatsächliche Wahrnehmung eines Bewohners vor der Handlung, die gewählte Handlung und die gelieferte Wahrnehmung danach an eine Episode-/Lauf-Linie. Nur vollständige frühere Datensätze sind zulässig. Der Selektor priority reiht zuerst collects mit nichtpositiver beobachteter Reserveänderung, füllt dann nach Recency. Der Vergleicher reiht nur nach Recency. Beide geben ausgewählte Datensätze chronologisch zurück, überspringen übergroße Kandidaten und deckeln das gesamte ausgewählte Array auf zwei Datensätze und 8192 Bytes. Die Auswahl aktualisiert keine Modellgewichte. Der Wirt behält das größere Archiv und Auslassungsbelege; das bewohnerseitige Gedächtnisbudget gilt für die ausgewählte Exposition, nicht für den gesamten Rechnerspeicher.

Beide responsiven Arme nutzen denselben zustandslosen verfassten Anbieter. Seine Regel hat eine ausdrückliche Uhr: bei Entscheidung 5, entsprechend elf verbleibenden Entscheidungen einschließlich der aktuellen, räumt sie nur, wenn sichtbares effort mindestens drei ist und die ausgewählte Erinnerung ein stalled collect enthält. Sie ruht durch das mittlere Intervall und sammelt mit positivem effort in den letzten vier Entscheidungen. Andere frühere Zweige reagieren auf Gedächtnis und gegenwärtige Wahrnehmung. Das Experiment verlangt daher von keinem Modell, eine Strategie zu entdecken. Die Anbieterquelle macht die Abhängigkeit prüfbar.

Zwei insensitive-Kontrollen sammeln, wenn das gegenwärtige effort positiv ist, sonst ruhen sie, ohne ausgewählte Erinnerung zu nutzen. Drei wörtliche Zeitpläne prüfen einen erfolgreichen Pfad, denselben Pfad mit Räumen bei Entscheidung 5 durch rest ersetzt, und durchgehendes Ruhen. Das verzögerte Ziel ist nur erfüllt, wenn eine vollständige, gültige 16-Entscheidungs-Episode eine endgültige Reserve von mindestens fünf hat. Ein früheres Überschreiten von fünf reicht nicht.

Der aufgezeichnete Prüfer rekonstruiert vor der Bewertung die Entsprechung unter Manifesten, Journalen, Versuchen, Anfragen, ausgewählten Erinnerungen, Handlungen, Beobachtungen und Endtatsachen. Er ist anbieterfrei; der Bewohner selbst nutzt weiter einen verfassten Anbieter. Eine gültige verfehlte Verpflichtung ist von ungültiger oder unvollständiger Evidenz verschieden. Diese Unterscheidung verhindert, dass ein Zielversagen still als ungültiger Datensatz verworfen wird und dass eine wohlgeformte Spur für ein erfolgreiches Ergebnis gehalten wird.

3. Ergebnisse in den gespeicherten Bedingungen

Die sieben aufgezeichneten Bedingungen enthalten je 16 Entscheidungen. Ihre 112 Entscheidungszeilen sind geschachtelte Messungen, keine 112 unabhängigen Stichproben. Die folgenden Werte wurden aus gespeicherten Lauf-/Prüfzusammenfassungen gelesen und gegen die zugehörigen extrahierten Endzustände geprüft. Es sind beschreibende Ergebnisse fester Bedingungen, ohne stichprobenbasiertes Intervall oder p-Wert. Gespeicherte Ergebnisse, Entscheidungsextraktion.

BedingungEndgültige ReserveTerminale Verpflichtung
responsive-priority5Erfüllt
responsive-recency0Verfehlt
insensitive-priority0Verfehlt
insensitive-recency0Verfehlt
literal-success-priority5Erfüllt
literal-no-clear-priority0Verfehlt
literal-all-rest-priority0Verfehlt
Reserve nach jeder von 16 Entscheidungen für gedächtnissensible und -insensitive Selektorpaare. Horizontal scrollen zur Prüfung.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Abbildung 1. Bereits verfasste Trajektorien. Das responsive Paar unterscheidet sich an der Räumungsentscheidung und danach in der Reserve. Das insensitive Paar hat identische Handlungen und Zustände. Die Anforderung gilt nur bei Entscheidung 15; Reserve fünf bei Entscheidung 0 ist keine Erfüllung. Linien verbinden aufgezeichnete Entscheidungszustände und bezeichnen keine zusätzlichen Beobachtungen.

Bei Entscheidung 5 behält priority die Erfahrungen [1,4] und räumt; recency behält [3,4] und ruht. Ihre ausgewählten Gedächtnisarrays enthalten 2693 bzw. 2692 Bytes, die erfassten Petition-JSON-Größen 5039 und 5038 Bytes. Gleiche Kapazitätsgrenzen implizieren daher keine identischen Bytezahlen oder LLM-Tokenkosten. Das sind Bytes, keine Tokenizer-Messungen. Quelle und gespeicherte Auswahl begründen an dieser Grenze einen Zwei-Datensatz-Engpass; sie begründen keinen bindenden 8192-Byte-Engpass.

Die zwei responsiven Episoden enden mit Reserve 5 und 0. Ihre wörtlichen Gegenstücke ergeben dieselben Reservetrajektorien; das Ersetzen des Räumens durch rest ändert das verzögerte Ergebnis in der verfassten Anordnung. Die zwei insensitiven Episoden haben identische 16-Schritt-Handlungs-/Zustandsfolgen trotz unterschiedlicher ausgewählter Erinnerungen. Das ist eine Kontrolle für die angegebene Entscheidungsregel, kein allgemeines Ergebnis, dass Gedächtnis nicht zählen könne.

4. Was die Differenz identifiziert

Die am stärksten gestützte Deutung ist bedingt: Eine Änderung der Auswahlrichtlinie ändert die Information, die dieser festen responsiven Regel zugeführt wird, ihre Handlung bei Entscheidung 5 und das gespeicherte Folgeergebnis. Die Abhängigkeit ist in die Regel konstruiert. Das Ergebnis identifiziert weder eine intrinsisch überlegene Gedächtnisrepräsentation noch spontanes Lernen.

Ein kritisches Detail ist im gespeicherten Recency-Träger sichtbar. Seine ausgewählten Gedächtnisbytes bei Entscheidung 5 enthalten Erfahrung 3, eine inspect-Handlung, deren Nachbeobachtung reading: 1 hat, das beobachtete Hindernissignal. Der Anbieter berechnet aus solchen Nachbeobachtungen eine Flagge, aber der Zweig der elf verbleibenden Entscheidungen prüft stattdessen stalledCollect. Er nutzt diese Hindernisflagge nicht, um an dieser Grenze das Räumen auszulösen. Folglich kann der unterlegene Recency-Arm nicht als ohne potenziell nützliche Warnung beschrieben werden. Das ist eine direkte Quellen-/Aufzeichnungsbeobachtung; die These, eine andere Richtlinie würde den Reiz nutzen, ist eine plausible alternative Erklärung zum Prüfen, kein hier neu ausgeführtes Experiment. Gespeicherter Recency-Träger, responsive Regel.

Der insensitive Vergleich hat ebenfalls eine behaltene Korrektur. Eine anfängliche Kontrolle erwartete unterschiedliche An-/Abwesenheit von stalled collects, aber beide Arme behielten eines. Die korrigierte Kontrolle betraf unterschiedliche behaltene Erfahrungen bei identischen Welttrajektorien. Das Behalten der ursprünglichen fehlgeschlagenen Erwartung verhindert, dass eine irrige Kontrollgeschichte in ein positives Ergebnis umgewandelt wird. Die angenommene Versuchsaufzeichnung dokumentiert diese Geschichte.

Keine Bedingung in dieser Menge isoliert die Notwendigkeit von Verzögerung oder Knappheit, indem sie sie variiert. Der Bericht beschreibt einen Mechanismus, der in ihrer Gegenwart wirkt. Er behauptet nicht, derselbe Selektor-Kontrast hänge einzig von einem der beiden Merkmale ab, oder er bestehe unter veralteten Fehlern, geänderten Voraussetzungen, anderen Richtlinien oder ungeprüften Welten fort.

5. Die Prüfung ist selbst ein Evidenzgegenstand

Anbieterausführung und strenges Wiedergeben teilen eine verfasste Regel. Ihre Übereinstimmung kann Konsistenz begründen und dabei eine gemeinsame Abweichung vom dokumentierten Vertrag verfehlen. Eine bewahrte private falsche Variante verkürzte das letzte Sammelfenster von vier Entscheidungen auf drei; die strenge Prüfung jener Kopie nahm die Episode an, während Entscheidung 12 inspect statt des unabhängig erwarteten collect zurückgab. Die ursprüngliche Produktregel war korrekt. Die Reserve vier der geänderten Richtlinie ist kein ungünstiges Selektorergebnis.

Ein additiver Test lieferte dann zwölf wörtliche Erwartungen über Entscheidungen 11, 12 und 15, positives/null effort und leere/behaltene stalled-collect-Erinnerung. Historische Protokolle verzeichnen das unveränderte Bestehen der Kontrolle und das Scheitern dreier kompilierender falscher Varianten an den vorgesehenen Zusicherungen. In dieser Forschungsaufnahme stimmten alle acht Implementierungs-Protokoll-Hashes und der aktuelle Testdatei-Hash mit ihren aufgezeichneten Werten überein, und die einschlägigen Fehlwahlmeldungen wurden geprüft. Das sind frische Integritäts-/Leseprüfungen historischer Evidenz, keine frisch ausgeführten Tests. Annahmeprüfung, wörtlicher Test, aufgezeichnete Befehle und Protokolle.

Aktuelle Byteprüfungen glichen auch alle 140 gespeicherten Episodendateien mit den sieben bestehenden Quittungen und alle 95 archivierten Quellen-/Moduleinträge mit dem responsive-priority-Manifest ab. Das stützt die Integrität des geprüften Pakets. Es bezeugt nicht, welches Binär ursprünglich lief, begründet nicht, dass jede Compilereingabe archiviert ist, und ersetzt keine frische unabhängige Reproduktion. Der Bericht bewahrt die dokumentierte Grenze der Quellenfindung: kompilierte Nutzung erfordert den Quellen-Checkout auf seinem Build-Pfad und einen Build ohne -trimpath. Ansprüche voller Infrastruktur, Absturz-Wiederherstellung und repositoryweiter Korrektheit bleiben außerhalb dieser Aufzeichnung.

6. Gesonderte frühere Entwicklungsevidenz

Der ältere Datensatz zur Artikelbereitschaft enthält acht verfasste Trajektorien, 128 geschachtelte Momente und vier adaptive/baseline-Profilvergleiche. Die Metrik ist die Summe der getragenen Reserve nach jedem ProcessMoment über die Momente 0–15, gemessen in Reserve-Einheiten-Momenten. Die Differenzen adaptive minus baseline sind +4, 0, 0 und −1. Sie sind nicht die priority/recency-Intervention oben und teilen deren terminalen Endpunkt nicht. Definitionen, vier Vergleiche.

Vier frühere Entwicklungsprofil-Differenzen: current plus vier, shifted null, clustered null, sparse minus eins. Horizontal scrollen zur Prüfung.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Abbildung 2. Alle vier früheren festen Profilvergleiche mit ihrer ursprünglichen kumulativen Metrik. Negative und Nullwerte bleiben erhalten. Diese Abbildung ist gesonderter Entwicklungskontext; sie ist keine zusätzliche Stichprobe zu Abbildung 1.

Zwei historische Machbarkeitsversuche mit lokalem Modell und zwei Zeilen Apparattopologie sind in jener älteren Aufnahme ebenfalls katalogisiert. Keine kann den sieben deterministischen Bedingungen hinzugefügt werden, um eine Verhaltensstichprobe zu vergrößern. Wiedergaben, Wiederholungen, Neubewertungen und mehrere Zeilen einer Trajektorie behalten ihre Linie. Die älteren Profile current, shifted, clustered und sparse sind bereits geprüft und können durch Umbenennen keine blinde Rücklage werden.

7. Stellung in der Literatur

Gedächtnissysteme kombinieren Interventionen, die zu unterscheiden sind. Generative Agents kombiniert Abruffaktoren einschließlich zugriffsbasierter Recency, Wichtigkeit und Relevanz; seine Interview-Ablationen nutzen von der vollen Architektur angesammelte Geschichten. Jene Auswertung motiviert, Entscheidungssonden gemeinsamer Geschichte von vollständigen Trajektorieninterventionen zu trennen. Sie validiert dieses Einzugsgebietsergebnis nicht. Park et al., 2023, §§4.1 and 6.1–6.2.

Reflexion ändert späteren Kontext durch textuelles Feedback, nicht durch Änderung der Basis-Modellgewichte. Sein WebShop-Anhang berichtet auch eine Einstellung, in der die versuchte Verbesserung nicht eintrat. Mechanismus und jene Grenze sprechen dagegen, Gedächtnis oder Reflexion als unbedingten Nutzen zu behandeln. Sie betreffen andere Aufgaben und Versuchsstrukturen als dieser Versuchsaufbau. Shinn et al., 2023, abstract and Appendix B.1.

Für eine spätere empirische Studie muss der Stichprobenumfang einem inferenziellen Ziel und begründeten Annahmen folgen. Präzisionsplanung etwa verlangt eine Zielintervallbreite und eine Darstellung der Variabilität; keine Arbeit liefert eine universell ausreichende Zahl von ORIGIN-Läufen. Lakens, 2022, “Planning for Precision”.

Artefaktverfügbarkeit/-funktionalität und unabhängig gewonnene Ergebnisse sind in der ACM-Artefaktterminologie getrennte Leistungen. Dieser Bericht bietet eine lokale Integritätsprüfung und eine reproduzierbare Ableitung der Abbildungen; er beansprucht kein Prüfabzeichen und keine unabhängige experimentelle Replikation. ACM SIGIR artifact criteria.

LongMemEval bewertet Lesestrategien mit orakelabgerufener Evidenz und zeigt, dass das Leserdesign die QA-Leistung auch dann beeinflusst, wenn die Evidenzsitzungen geliefert werden. Das stärkt die Unterscheidung von Abruf und Nutzung in einer Chatverlauf-QA-Aufgabe. Es misst keine Handlung in einer persistenten Welt. Wu et al., v2, §5.5.

XENON koppelt Erfahrungsgedächtnis an Abhängigkeitskorrektur und Kandidatenhandlungs-Korrektur. Es ist daher eine Referenz für eine andere Intervention als die Änderung der Episodenexposition bei festem Wähler dieses Versuchsaufbaus. Lee et al., v3, §§4.1–4.2.

Vending-Bench trennt Grenzen des rezenten Kontexts von externen Gedächtniswerkzeugen ohne ausdrückliche Speicherbeschränkungen. Seine ursprüngliche GPT-4o-mini-Kontextkapazitäts-Ablation berichtet schlechtere Ergebnisse bei größeren Grenzen. Das warnt davor, jede Gedächtnisschicht als ein Budget zu behandeln oder monotonem Nutzen anzunehmen; sein Geschäftsfeld und historische Modelle sind keine ORIGIN-Ergebnisse. Backlund and Petersson, v1, §§2.1 and 3.5.2.

Die Few-Run-RL-Analyse von Agarwal und Kollegen betrifft Variabilität über stochastische Trainings-/Auswertungsläufe. Ihre statistischen Empfehlungen erfordern eine passende Stichprobenstruktur und liefern keine Konfidenzintervalle für diese sieben verfassten Bedingungen. Agarwal et al., NeurIPS 2021.

Menschliche/nichtmenschliche und Rechen-/Quantenbefunde bleiben getrennte Portfolioeingaben, keine Evidenz für das gegenwärtige Ergebnis. Die Quellenfeststellung zeichnet den zugelassenen Umfang und Korrekturen zu überengen oder unvollständigen Sammelzusammenfassungen auf.

8. Eine falsifizierbare Fortsetzung

Eine nächste empirische Frage könnte lauten, ob der Selektor-Kontrast die Zielwahrscheinlichkeit vollständiger Episoden für eine erklärte Modell-/Aufgabenverteilung ändert. Die Richtung muss offen bleiben. Ein nützliches negatives Ergebnis würde einen einschlägigen Fehlerdatensatz behalten, ohne die gewählte Handlung oder das terminale Ergebnis zu verbessern; ein schädliches Ergebnis wäre ebenfalls aufschlussreich. Die gegenwärtige Quellenprüfung motiviert zusätzlich, Behalten vom Hinweisnutzungsvertrag der Entscheidungsregel zu unterscheiden.

Vor jeder Erhebung sind die zulässigen Beobachtungen, zugänglicher Speicher und Exposition je Entscheidung, Selektor-/Gleichstands-/Überlaufregeln, gelieferte Prompts, Modell und angeforderte/berichtete Version, Ressourcengrenzen, Welt-/Anfangszustandsverteilung, geschützte Rücklage, Frist, Erwartungen des unabhängigen Bewerters, Fehler-/Wiederholungslinie, Stoppregel und Primäranalyse festzulegen. Die erlaubten Ressourcendeckel sind einzuhalten und der tatsächliche Verbrauch zu berichten. Nach-Interventions-Welt-/Beobachtungstrajektorien dürfen nicht zur Gleichheit gezwungen werden; jene Differenzen können den untersuchten Effekt tragen.

Vollständige Episoden als Einheiten nutzen, mit erklärten Aufgabenblöcken oder -paaren. Geteilte Welten mit interagierenden Bewohnern erfordern Gruppen-/Welteinheiten. Den Nenner aller gestarteten Episoden und den Umgang mit nicht verfügbaren Ergebnissen vor dem Blick auf die Resultate angeben. Ein gemeinsamer Samen garantiert nach Auseinanderlaufen der Trajektorien keine entsprechende Modellzufälligkeit. Eine sinnvolle Effekt- oder Präzisionszielgröße wählen und die Empfindlichkeit des Stichprobenumfangs unter vertretbaren Annahmen prüfen; diese Größen bleiben hier ungesetzt. Das ist eine vorgeschlagene Studie, keine Präregistrierung und kein abgeschlossenes empirisches Ergebnis.

9. Reproduktion und Verfügbarkeit

Die zugrunde liegende Quelle und die Laufzeitaufzeichnungen bleiben privat. Diese Leseausgabe bewahrt die wissenschaftlichen Ansprüche und aufgezeichneten Werte des intern geprüften Entwurfs. Örtliche Quellen- und Prüfungsbezüge im Text nennen Aufzeichnungen in jenem privaten Paket; sie sind keine öffentlichen Artefaktlinks.

Die zwei SVG-Abbildungen sind aus den für diese Website angenommenen Extraktions- und Vergleichswerten neu gezeichnet. Abbildungswerte stehen zur Prüfung der gezeichneten Punkte bereit. Eine Abbildung neu zu bauen ist etwas anderes als die Welt wiederzugeben. Diese abgeleiteten Werte ersetzen weder die zugrunde liegende Quelle noch die Episodenaufzeichnungen noch den unabhängigen Bewerter.

Eine öffentliche Forschungsfreigabe verlangt weiterhin zurechenbare Urheberschaft, ein eingefrorenes Quellen-/Daten- und Schwärzungspaket, stabile Artefaktlinks und Prüfung jenes Freigabepakets. Die sind hier weder zugewiesen noch freigegeben. Die abgeschlossene interne Prüfung deckt das technische Manuskript und seine Abbildungen; sie ist keine Zeitschriften-Peer-Review und keine unabhängige Ausführung des Versuchsaufbaus. Korrekturen bleiben Teil der Forschungsaufzeichnung.

Revisionsgeschichte

9. September 2026. Webleseausgabe des intern geprüften technischen Entwurfs. Wissenschaftliche Ansprüche und aufgezeichnete Werte bleiben erhalten. Örtliche Dateisystemlinks entfallen; die zwei Abbildungen sind aus denselben aufgezeichneten Werten für eine dunkle Lesefläche neu gezeichnet. Quelle und Laufzeitaufzeichnungen bleiben privat. Das ist keine öffentliche Artefaktfreigabe und keine Zeitschriften-Peer-Review. Die Oberflächen enthalten eine vollständige Übersetzung dieser Leseausgabe; der englische Text bleibt das Original.

Аннотация

Ограниченная память может изменить будущие действия агента, но сохранение прошлой неудачи не устанавливает обучение и не гарантирует, что сведения будут использованы. Мы разбираем существующую установку ORIGIN, в которой два детерминированных селектора предъявляют фиксированному правилу решения разные прошлые опыты. Один житель действует в составленном водосборе с ограниченным ресурсом 16 решений и должен закончить не менее чем с пятью единицами резерва. Оба селектора допускают две записи и не более 8192 канонических байт UTF-8. Архивный эпизод responsive-priority достигает обязательства; его recency-пара — нет. Два контроля, игнорирующие выбранную память, следуют одинаковым последовательностям действие/состояние и оба не выполняют обязательство. Решающая зависимость явно составлена: recency удерживает наблюдаемый сигнал препятствия, но ветвь правила на решении 5 отвечает именно на запомненный stalled collect. Отчёт поэтому фиксирует ограниченный механизм и пределы его проверки. Он не оценивает популяционный эффект и не демонстрирует обучение LLM, мотивацию, выживание или межвидовую эквивалентность. Мы сохраняем отдельные нулевые/неблагоприятные сравнения разработки и указываем, что понадобилось бы позднейшему эмпирическому исследованию.

Термины

ORIGIN
Собственное имя проекта. Не переводится.
Sol-III
Собственное имя составленного мира водосбора. Не переводится.
отложенное обязательство [delayed obligation]
Требование, оцениваемое только после решения 15: итоговый резерв не меньше пяти. Превышение пяти раньше не есть завершение.
застопорившийся сбор [stalled collect]
Действие collect без видимого роста резерва, включая снижение. Предикат селектора; скрытую причину не именует. Идентификатор источника: stalledCollect.
селектор [selector]
Политика выбора архивных записей, которые может видеть житель. Здесь: priority против recency, у каждого предел в две записи и 8192 байта UTF-8.
установка [apparatus]
Уже записанная детерминированная установка: мир, селекторы, поставщик, верификатор и сохранённые эпизоды. Этот отчёт её читает, а не перезапускает.
житель [resident]
Действующий агент в водосборе. Это не биологический организм; нулевой резерв не есть смерть.
резерв [reserve]
Конечный счётчик ресурса в составленном мире. Отложенное обязательство требует итоговый резерв ≥ 5.

1. Вопрос и свидетельства

Исследовательский вопрос: меняет ли при той же ёмкости памяти приоритет собственных наблюдённых опытов неудачного действия жителя над недавними опытами выполнение отложенного обязательства — и при каких условиях помнение этих опытов оставляет поведение неизменным. Нынешний ответ ограничен уже завершённой детерминированной установкой. Он полезен тем, что выбранные сведения, действие по правилу, авторитетное изменение мира и исход можно разобрать по отдельности.

Установка была завершена до этой исследовательской приёмки. Отчёт читает её исходник, принятые записи, семь сохранённых эпизодов и производную таблицу решений. Он добавляет аудит исходника/записей и рисунки, выведенные из этих сохранённых данных. Он не исполняет мир, Go-тест или верификатор, живую модель или аппаратный эксперимент. Четыре внешних исследовательских записки дали кандидатные вопросы и источники; их ответы не эмпирические свидетельства. Сопровождающая таблица утверждений/источников различает оригинальные находки, локальные наблюдения, гипотезы и непроверенные зацепки.

«Неудача» требует операционального определения. Предикат селектора — действие collect без видимого роста резерва, включая снижение. Он не указывает скрытое причинное объяснение и не утверждает, что действие отвергнуто. «Отложенное» относится к последствиям более ранних действий для позднейшей доступности ресурса и к обязательству, оцениваемому только после решения 15. «Долгосрочное» обозначает этот конечный горизонт, а не бессрочное развёртывание. Эти определения следуют реализованному селектору и договору установки.

2. Завершённая установка

Существующий водосбор Sol-III current — составленный безразмерный мир. Исходник задаёт начальный резерв 4, effort 1, запасённый ресурс 2 и препятствие. У резерва, effort и склада конечные потолки. Житель выбирает среди inspect, collect, clear и rest. Очистка меняет состояние препятствия и тем самым позднейший захват дождя. Текущее восприятие показывает резерв, effort и отсчёт наблюдения; оно не показывает напрямую каждую переменную мира. Объявления ресурса и жизненного цикла не превращают нулевой резерв в смерть: жители могут продолжать действовать при нуле. Измеряемая конечная точка поэтому — снабжение к сроку, не выживание. Это описания на уровне исходника world.go, а не притязания на биологический реализм.

Каждая запись памяти связывает фактическое восприятие жителя до действия, выбранное действие и доставленное восприятие после действия с линией эпизода/прогона. Допустимы только полные предшествующие записи. Селектор priority сначала ранжирует collect с неположительным наблюдённым изменением резерва, затем заполняет по recency. Компаратор ранжирует только по recency. Оба возвращают выбранные записи хронологически, пропускают чрезмерные кандидаты и ограничивают весь выбранный массив двумя записями и 8192 байтами. Выбор не обновляет веса модели. Хост сохраняет больший архив и свидетельства пропуска; бюджет памяти, обращённый к жителю, относится к выбранному предъявлению, а не к полному хранилищу компьютера.

Обе отзывчивые ветви используют одного и того же бессостоятельного составленного поставщика. У его правила явные часы: на решении 5, что соответствует одиннадцати оставшимся решениям включая текущее, оно очищает только если видимый effort не меньше трёх и выбранная память содержит stalled collect. Оно отдыхает в среднем интервале и собирает при положительном effort в последние четыре решения. Другие более ранние ветви отвечают на память и текущее восприятие. Таким образом эксперимент не просит модель открыть стратегию. Исходник поставщика делает зависимость проверяемой.

Два контроля insensitive собирают, когда текущий effort положителен, иначе отдыхают, не используя выбранную память. Три буквальных расписания проверяют успешный путь, тот путь с очисткой на решении 5, заменённой rest, и поведение сплошного rest. Отложенная цель удовлетворена только когда полный действительный эпизод из 16 решений имеет итоговый резерв не меньше пяти. Пересечение пяти раньше недостаточно.

Записанный верификатор до оценки восстанавливает соответствие манифестов, журналов, попыток, запросов, выбранных памятей, действий, наблюдений и конечных фактов. Он свободен от поставщика; сам житель по-прежнему использует составленного поставщика. Действительное невыполненное обязательство отлично от недействительных или неполных свидетельств. Это различение мешает тихо отбросить провал цели как недействительную запись и принять правильно построенный след за успешный исход.

3. Результаты в сохранённых условиях

Семь записанных условий содержат по 16 решений. Их 112 строк решений — вложенные измерения, не 112 независимых выборок. Следующие значения прочитаны из сохранённых сводок прогона/проверки и сверены с соответствующими извлечёнными конечными состояниями. Это описательные результаты фиксированных условий без интервала или p-значения на основе выборки. Сохранённые результаты, извлечение решений.

УсловиеИтоговый резервКонечное обязательство
responsive-priority5Выполнено
responsive-recency0Не выполнено
insensitive-priority0Не выполнено
insensitive-recency0Не выполнено
literal-success-priority5Выполнено
literal-no-clear-priority0Не выполнено
literal-all-rest-priority0Не выполнено
Резерв после каждого из 16 решений для пар селекторов, чувствительных и нечувствительных к памяти. Прокрутите по горизонтали.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Рисунок 1. Уже составленные траектории. Отзывчивая пара расходится на решении об очистке и далее в резерве. Нечувствительная пара имеет одинаковые действия и состояния. Требование действует только на решении 15; резерв пять на решении 0 не есть завершение. Линии соединяют записанные состояния решений и не обозначают дополнительных наблюдений.

На решении 5 priority удерживает опыты [1,4] и очищает; recency удерживает [3,4] и отдыхает. Их массивы выбранной памяти содержат 2693 и 2692 байта соответственно, а захваченные размеры Petition JSON — 5039 и 5038 байт. Равные потолки ёмкости поэтому не означают одинаковых чисел байт или затрат токенов LLM. Это байты, не измерения токенизатора. Исходник и сохранённый выбор устанавливают на этой границе узкое место из двух записей; они не устанавливают обязывающего узкого места в 8192 байта.

Два отзывчивых эпизода заканчиваются резервом 5 и 0. Их буквальные пары дают те же траектории резерва; замена очистки на rest меняет отложенный исход в составленной установке. Два нечувствительных эпизода имеют одинаковые 16-шаговые последовательности действие/состояние при разных выбранных памятях. Это контроль для указанного правила решения, а не общий результат, что память не может иметь значения.

4. Что выявляет различие

Наиболее поддержанное толкование условно: смена политики выбора меняет сведения, подаваемые этому фиксированному отзывчивому правилу, его действие на решении 5 и сохранённый последующий исход. Зависимость встроена в правило. Результат не выявляет внутренне превосходящего представления памяти и не спонтанного обучения.

В сохранённом носителе recency видна критическая подробность. Байты выбранной памяти на решении 5 включают опыт 3, действие inspect, чьё поснаблюдение имеет reading: 1, наблюдённый сигнал препятствия. Поставщик вычисляет флаг из таких поснаблюдений, но ветвь одиннадцати оставшихся решений проверяет вместо этого stalledCollect. Она не использует этот флаг препятствия, чтобы вызвать очистку на этой границе. Следовательно, проигравшую recency-ветвь нельзя описать как не имеющую потенциально полезного предупреждения. Это прямое наблюдение исходника/записи; положение, что другая политика использовала бы подсказку, — правдоподобное альтернативное объяснение для проверки, а не новый эксперимент, выполненный здесь. Сохранённый носитель recency, отзывчивое правило.

У нечувствительного сравнения также есть сохранённое исправление. Начальный контроль ожидал разного наличия/отсутствия stalled collect, но обе ветви удержали по одному. Исправленный контроль касался разных удержанных опытов при одинаковых траекториях мира. Сохранение исходного несбывшегося ожидания мешает превратить ошибочную контрольную историю в положительный результат. Принятая запись установки документирует эту историю.

Ни одно условие в этом наборе не изолирует необходимость задержки или дефицита, варьируя их. Отчёт описывает механизм, действующий при их наличии. Он не утверждает, что тот же контраст селекторов зависит единственно от какого-либо из этих свойств, или что он сохраняется при устаревших неудачах, изменённых предпосылках, иных политиках или неисследованных мирах.

5. Проверка сама есть предмет свидетельства

Исполнение поставщика и строгое воспроизведение разделяют составленное правило. Их согласие может установить согласованность, пропустив общее отклонение от задокументированного договора. Сохранённый частный неверный вариант сократил финальное окно сбора с четырёх решений до трёх; строгая проверка той копии приняла эпизод, тогда как решение 12 вернуло inspect вместо независимо ожидаемого collect. Исходное продуктовое правило было верным. Резерв четыре изменённой политики не есть неблагоприятный результат селектора.

Аддитивный тест затем дал двенадцать буквальных ожиданий по решениям 11, 12 и 15, положительному/нулевому effort и пустой/удержанной памяти stalled collect. Исторические журналы фиксируют прохождение неизменённого контроля и провал трёх компилируемых неверных вариантов на намеченных утверждениях. В этой исследовательской приёмке все восемь хешей журналов реализации и текущий хеш файла тестов совпали с записанными значениями, и соответствующие сообщения о неверном выборе были осмотрены. Это свежие проверки целостности/чтения исторических свидетельств, не свеже исполненные тесты. Аудит приёмки, буквальный тест, записанные команды и журналы.

Текущие проверки байт также сопоставили все 140 сохранённых файлов эпизодов с семью существующими квитанциями и все 95 архивных записей исходника/модуля с манифестом responsive-priority. Это поддерживает целостность осмотренного пакета. Оно не свидетельствует, какой двоичный файл изначально исполнялся, не устанавливает, что каждый вход компилятора архивирован, и не заменяет свежее независимое воспроизведение. Отчёт сохраняет задокументированное ограничение обнаружения исходника: скомпилированное использование требует checkout исходника на его пути сборки и сборки без -trimpath. Утверждения о полной инфраструктуре, восстановлении после сбоя и корректности всего репозитория остаются вне этой записи.

6. Отдельные более ранние свидетельства разработки

Более старый набор данных готовности статьи содержит восемь составленных траекторий, 128 вложенных моментов и четыре сравнения профилей adaptive/baseline. Метрика — сумма несомого резерва после каждого ProcessMoment по моментам 0–15, в момент-единицах резерва. Разности adaptive минус baseline равны +4, 0, 0 и −1. Это не вмешательство priority/recency выше, и они не разделяют его конечную точку. Определения, четыре сравнения.

Четыре более ранних разности профилей разработки: current плюс четыре, shifted ноль, clustered ноль, sparse минус один. Прокрутите по горизонтали.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

Рисунок 2. Все четыре более ранних фиксированных сравнения профилей с исходной кумулятивной метрикой. Неблагоприятные и нулевые значения сохранены. Этот рисунок — отдельный контекст разработки; это не дополнительная выборка для рисунка 1.

В той более старой приёмке также каталогизированы два исторических испытания осуществимости локальной модели и две строки топологии установки. Ничто нельзя добавить к семи детерминированным условиям, чтобы расширить поведенческую выборку. Воспроизведения, повторы, пересчёт и несколько строк одной траектории сохраняют линию. Более старые профили current, shifted, clustered и sparse уже осмотрены и не могут стать слепым отложенным набором от переименования.

7. Место в литературе

Системы памяти сочетают вмешательства, которые следует различать. Generative Agents сочетает факторы извлечения, включая recency по доступу, важность и релевантность; его абляции интервью используют истории, накопленные полной архитектурой. Эта оценка побуждает отделять зонды решения общей истории от вмешательств полной траектории. Она не подтверждает этот результат водосбора. Park et al., 2023, §§4.1 and 6.1–6.2.

Reflexion меняет последующий контекст текстовой обратной связью, не меняя веса базовой модели. Приложение WebShop также сообщает обстановку, в которой задуманное улучшение не осуществилось. И механизм, и это ограничение против того, чтобы считать память или рефлексию безусловной пользой. Они касаются иных задач и структур проб, чем эта установка. Shinn et al., 2023, abstract and Appendix B.1.

Для позднейшего эмпирического исследования размер выборки должен следовать выводной цели и обоснованным допущениям. Планирование по точности, например, требует целевой ширины интервала и отчёта об изменчивости; ни одна статья не даёт универсально достаточного числа прогонов ORIGIN. Lakens, 2022, “Planning for Precision”.

Доступность/функциональность артефактов и независимо полученные результаты — отдельные достижения в терминологии артефактов ACM. Этот отчёт предлагает локальный аудит целостности и воспроизводимый вывод рисунков; он не притязает на знак рецензии или независимое экспериментальное воспроизведение. ACM SIGIR artifact criteria.

LongMemEval оценивает стратегии чтения с оракульно извлечёнными свидетельствами и показывает, что устройство читателя влияет на качество QA даже когда сеансы свидетельств поданы. Это усиливает различение извлечения и использования в задаче QA по истории чата. Оно не измеряет действие в устойчивом мире. Wu et al., v2, §5.5.

XENON связывает память опыта с исправлением зависимостей и исправлением действий-кандидатов. Это поэтому ссылка на иное вмешательство, чем смена предъявления эпизода при фиксированном выбирателе этой установки. Lee et al., v3, §§4.1–4.2.

Vending-Bench отделяет пределы недавнего контекста от внешних инструментов памяти без явных ограничений хранения. Исходная абляция ёмкости контекста GPT-4o-mini сообщает худшие исходы при больших пределах. Это предостерегает не считать каждый слой памяти одним бюджетом и не предполагать монотонной пользы; его деловая область и исторические модели не результаты ORIGIN. Backlund and Petersson, v1, §§2.1 and 3.5.2.

Анализ RL с малым числом прогонов Агарвала и коллег касается изменчивости по стохастическим прогонам обучения/оценки. Его статистические рекомендации требуют подходящей выборочной структуры и не дают доверительных интервалов для этих семи составленных условий. Agarwal et al., NeurIPS 2021.

Человеческие/нечеловеческие и вычислительные/квантовые находки остаются отдельными входами портфеля, не свидетельством настоящего результата. Разбор источников фиксирует допущенный охват и исправления слишком узких или неполных сводок сбора.

8. Фальсифицируемое продолжение

Следующий эмпирический вопрос мог бы спрашивать, меняет ли контраст селекторов вероятность цели полного эпизода для заявленного распределения модели/задачи. Направление должно оставаться открытым. Полезный отрицательный результат удержал бы относящуюся неудачу без улучшения выбранного действия или конечного исхода; вредный результат также был бы информативен. Нынешний осмотр исходника дополнительно побуждает отличать удержание от договора использования подсказки правила решения.

До любого сбора определить допустимые наблюдения, доступное хранилище и предъявление на решение, правила селектора/ничьей/переполнения, доставленные подсказки, модель и запрошенную/сообщённую версию, пределы ресурса, распределение мира/начального состояния, защищённый отложенный набор, срок, ожидания независимого оценщика, линию неудачи/повтора, правило остановки и первичный анализ. Сопоставлять разрешённые потолки ресурса, сообщая фактическое потребление. Не принуждать после-вмешательственные траектории мира/наблюдения оставаться равными; эти различия могут нести изучаемый эффект.

Использовать полные эпизоды как единицы, с объявленными блоками или парами задач. Общие миры с взаимодействующими жителями требуют единиц группы/мира. Указать знаменатель всех запущенных эпизодов и обращение с недоступными исходами до просмотра результатов. Общее зерно не гарантирует соответствующего случайности модели после расхождения траекторий. Выбрать значимый эффект или цель точности и оценить чувствительность размера выборки при защитимых допущениях; эти величины здесь не заданы. Это предложенное исследование, не пререгистрация и не завершённый эмпирический результат.

9. Воспроизведение и доступность

Лежащий в основе исходник и записи выполнения остаются закрытыми. Это читательское издание сохраняет научные утверждения и записанные значения внутренне рассмотренного черновика. Местные ссылки на исходник и аудит в тексте именуют записи в том закрытом пакете; это не публичные ссылки на артефакты.

Два рисунка SVG перерисованы из принятых для этого сайта значений извлечения и сравнения. Значения рисунков доступны для осмотра нанесённых точек. Перестройка рисунка отличается от воспроизведения мира. Эти производные значения не заменяют лежащий в основе исходник, записи эпизодов и независимого оценщика.

Публичный выпуск исследования по-прежнему требует подотчётного авторства, замороженного пакета исходника/данных и редактуры, стабильных ссылок на артефакты и разбора того пакета выпуска. Здесь они не назначены и не выпущены. Завершённый внутренний разбор покрывает техническую рукопись и её рисунки; это не журнальное рецензирование и не независимое исполнение установки. Исправления остаются частью исследовательской записи.

История правок

9 сентября 2026. Веб-читательское издание внутренне рассмотренного технического черновика. Научные утверждения и записанные значения сохранены. Ссылки на локальную файловую систему опущены; два рисунка перерисованы из тех же записанных значений для тёмной поверхности чтения. Исходник и записи выполнения остаются закрытыми. Это не публичный выпуск артефактов и не журнальное рецензирование. Интерфейсы включают полный перевод этого читательского издания; английский текст остаётся оригиналом.

الملخص

يمكن للذاكرة المحدودة أن تغيّر أفعال الفاعل لاحقاً، لكن حفظ إخفاق سابق لا يُثبت تعلّماً ولا يضمن استخدام المعلومة. نفحص جهازاً قائماً في ORIGIN يعرض فيه مُنتقيان حتميان خبرات ماضية مختلفة على قاعدة قرار ثابتة. يتصرّف مقيم واحد في حوض مؤلَّف مقيّد الموارد عبر 16 قراراً، وعليه أن ينتهي بما لا يقل عن خمس وحدات احتياطي. يسمح كل مُنتقٍ بسجلّين وبما لا يزيد على 8192 بايت UTF-8 قانوني. تبلغ حلقة responsive-priority المؤرشفة الالتزام؛ ولا تبلغه مقابلة الحداثة. يتبع ضابطان يتجاهلان الذاكرة المختارة تسلسلات فعل/حالة متطابقة ويُخفق كلاهما في الالتزام. التبعية الحاسمة مؤلَّفة صراحة: تحتفظ الحداثة بإشارة عائق مرصودة، لكن فرع القاعدة عند القرار 5 يستجيب خصوصاً لجمع متوقف [stalled collect] مُتذكَّر. يوثّق التقرير إذاً آلية محدودة وحدود التحقق منها. وهو لا يقدّر أثراً مجتمعياً ولا يُظهر تعلّم نماذج لغوية كبيرة ولا دافعاً ولا بقاءً ولا تكافؤاً بين الأنواع. نُبقي مقارنات تطوير صفرية/معاكسة منفصلة ونحدّد ما تحتاج إليه دراسة تجريبية لاحقة.

المصطلحات

ORIGIN
اسم علم للمشروع. لا يُترجم.
Sol-III
اسم علم لعالم الحوض المؤلَّف. لا يُترجم.
التزام مؤجّل [delayed obligation]
شرط يُحتسب فقط بعد القرار 15: احتياطي نهائي لا يقل عن خمسة. تجاوز الخمسة قبل ذلك ليس إتماماً.
جمع متوقف [stalled collect]
فعل collect دون زيادة مرئية في الاحتياطي، بما في ذلك النقصان. محمول المُنتقي؛ لا يسمّي سبباً خفياً. معرّف المصدر: stalledCollect.
مُنتقٍ [selector]
السياسة التي تختار أي السجلات المؤرشفة يجوز للمقيم رؤيتها. هنا: priority مقابل recency، وكلّ منهما محدود بسجلّين و8192 بايت UTF-8.
جهاز تجريبي [apparatus]
التركيب الحتمي المسجّل سلفاً: العالم، والمُنتقِيات، والمزوّد، والمدقّق، والحلقات المحفوظة. يقرأ هذا التقرير ذلك التركيب ولا يعيد تشغيله.
مقيم [resident]
الفاعل في الحوض. ليس كائناً بيولوجياً، والاحتياطي الصفري ليس موتاً.
احتياطي [reserve]
عدّاد المورد المحدود في العالم المؤلَّف. يتطلّب الالتزام المؤجّل احتياطياً نهائياً ≥ 5.

1. السؤال والشاهد

سؤال البحث هو ما إذا كان تقديم خبرات الفعل الفاشل التي رصدها المقيم نفسه على الخبرات الحديثة، عند السعة نفسها، يغيّر إتمام التزام مؤجّل—وفي أي شروط يترك تذكّر تلك الخبرات السلوك بلا تغيير. الجواب الحالي مقصور على جهاز حتمي مكتمل سلفاً. وهو مفيد لأن المعلومات المختارة، والفعل المعتمد على القاعدة، وتغيّر العالم ذي السلطة، والنتيجة يمكن فحصها منفصلة.

اكتمل الجهاز قبل تلقّي هذا البحث. يقرأ هذا التقرير مصدره، والسجلات المقبولة، وسبع حلقات محفوظة، وجدول القرارات المشتق. ويضيف تدقيق مصدر/سجل وأشكالاً مشتقة من تلك البيانات المحفوظة. وهو لا ينفّذ العالم، ولا اختبار Go أو مدقّقاً، ولا نموذجاً حياً، ولا تجربة عتاد. قدّمت أربع مذكرات بحث خارجية أسئلة ومصادر مرشّحة؛ وإجاباتها ليست شواهد تجريبية. يميّز جدول الدعاوى/المصادر المرافق النتائج الأصلية، والملاحظات المحلية، والفرضيات، والخيوط غير المحقَّقة.

يتطلّب «الإخفاق» تعريفاً إجرائياً. محمول المُنتقي هو فعل collect لا يتبعه زيادة مرئية في الاحتياطي، بما في ذلك النقصان. وهو لا يحدّد تفسيراً سببياً خفياً ولا يزعم أن الفعل رُفض. «مؤجّل» يشير إلى عواقب أفعال أسبق تؤثّر في توفّر المورد لاحقاً، وإلى التزام يُقيَّم فقط بعد القرار 15. «طويل الأمد» يدل على هذا الأفق المحدود؛ وليس نشراً غير محدّد. تتبع هذه التعريفات المُنتقي المنفَّذ وعقد الجهاز.

2. الجهاز المكتمل

حوض Sol-III current القائم عالم مؤلَّف بلا أبعاد. يحدّد مصدره احتياطياً ابتدائياً 4، وeffort 1، ومورداً مخزوناً 2، وعائقاً. للاحتياطي وeffort والمخزن سقوف محدودة. يختار المقيم بين inspect وcollect وclear وrest. تغيّر الإزالة حالة العائق وبذلك التقاط المطر لاحقاً. يُظهر الإدراك الحالي الاحتياطي وeffort وقراءة رصد؛ ولا يُظهر مباشرة كل متغيّر عالم. إعلانات المورد ودورة الحياة لا تجعل الاحتياطي الصفري موتاً: يمكن للمقيمين مواصلة الفعل عند الصفر. فالنقطة المقاسة إذاً تموين عند أجل، لا بقاء. هذه أوصاف على مستوى مصدر world.go، وليست دعاوى واقعية بيولوجية.

يربط كل سجل ذاكرة إدراك المقيم الفعلي قبل الفعل، والفعل المختار، والإدراك بعد الفعل المسلَّم بنسب حلقة/تشغيل. لا يُقبل إلا السجلات السابقة الكاملة. يرتّب المُنتقي priority أولاً عمليات collect ذات تغيّر احتياطي مرصود غير موجب، ثم يملأ بالحداثة. يرتّب المقارن بالحداثة وحدها. يعيد كلاهما السجلات المختارة زمنياً، ويتجاوز المرشحين المفرطين، ويحدّ المصفوفة المختارة كلها بسجلّين و8192 بايت. الاختيار لا يحدّث أوزان نموذج. يحتفظ المضيف بالأرشيف الأكبر وشواهد الحذف؛ وميزانية الذاكرة المواجهة للمقيم تسري على التعريض المختار، لا على تخزين الحاسوب الكلي.

يستعمل الذراعان المستجيبان المزوّد المؤلَّف عديم الحالة نفسه. لقاعدته ساعة صريحة: عند القرار 5، المقابل لأحد عشر قراراً متبقياً بما فيها الحالي، يُزيل فقط إذا كان الـeffort المرئي ثلاثة على الأقل واحتوت الذاكرة المختارة جمعاً متوقفاً. يستريح في الفترة الوسطى ويجمع بجهد موجب في القرارات الأربعة الأخيرة. فروع أسبق أخرى تستجيب للذاكرة والإدراك الحالي. لذا لا يطلب التجريب من نموذج أن يكتشف استراتيجية. مصدر المزوّد يجعل التبعية قابلة للفحص.

يجمع ضابطان insensitive عندما يكون الـeffort الحالي موجباً وإلا يستريحان، دون استخدام الذاكرة المختارة. تفحص ثلاثة جداول حرفية مساراً ناجحاً، وذلك المسار مع استبدال إزالة القرار 5 بـrest، وسلوك الراحة كلها. لا يُستوفى الهدف المؤجّل إلا عندما تكون حلقة كاملة صالحة ذات 16 قراراً باحتياطي نهائي خمسة على الأقل. تجاوز الخمسة قبل ذلك لا يكفي.

يعيد المدقّق المسجّل بناء التقابل بين البيانات والسجلات والمحاولات والطلبات والذاكرات المختارة والأفعال والرصد والوقائع النهائية قبل التسجيل. وهو مستقل عن المزوّد؛ ولا يزال المقيم نفسه يستعمل مزوّداً مؤلَّفاً. الالتزام الفائت الصالح متميز عن الشاهد الباطل أو الناقص. يمنع هذا التمييز أن يُنبذ إخفاق الهدف صمتاً كسجل باطل، وأن تُحسب أثرية حسنة التكوين نتيجة ناجحة.

3. النتائج في الشروط المحفوظة

تحوي الشروط المسجّلة السبعة كلاً منها 16 قراراً. صفوف القرارات الـ112 قياسات متداخلة، وليست 112 عيّنة مستقلة. قُرئت القيم التالية من ملخصات تشغيل/تحقق محفوظة وقوبلت بالحالات النهائية المستخرجة المقابلة. هي نتائج وصفية لشروط ثابتة، بلا فترة أو قيمة p قائمة على عيّنة. نتائج محفوظة، استخراج قرارات.

الشرطالاحتياطي النهائيالالتزام الختامي
responsive-priority5مُستوفى
responsive-recency0غير مستوفى
insensitive-priority0غير مستوفى
insensitive-recency0غير مستوفى
literal-success-priority5مُستوفى
literal-no-clear-priority0غير مستوفى
literal-all-rest-priority0غير مستوفى
الاحتياطي بعد كل قرار من 16 لزوجي مُنتقِيات حسّاسة وغير حسّاسة للذاكرة. مرّر أفقياً للمعاينة.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

الشكل 1. مسارات مؤلَّفة قائمة. يختلف الزوج المستجيب عند قرار الإزالة ثم في الاحتياطي. للزوج غير الحسّاس أفعال وحالات متطابقة. يسري الشرط عند القرار 15 فقط؛ احتياطي خمسة عند القرار 0 ليس إتماماً. الخطوط تصل حالات القرار المسجّلة ولا تدل على ملاحظات إضافية.

عند القرار 5 يحتفظ priority بالخبرات [1,4] ويزيل؛ وتحتفظ recency بـ[3,4] وتستريح. تحوي مصفوفتا الذاكرة المختارة 2693 و2692 بايت على التوالي، وأحجام JSON لـPetition الملتقطة 5039 و5038 بايت. فسقوف السعة المتساوية لا تقتضي إذاً أعداد بايت متطابقة ولا تكاليف رموز لنماذج لغوية كبيرة. هذه بايتات، لا قياسات مُقطِّع. يُثبت المصدر والاختيار المحفوظ عنق زجاجة بسجلّين عند هذا الحد؛ ولا يُثبتان عنق زجاجة مُلزِماً بـ8192 بايت.

تنتهي الحلقتان المستجيبتان باحتياطي 5 و0. تعطي مقابلاتهما الحرفية المسارات الاحتياطية نفسها؛ واستبدال الإزالة بـrest يغيّر الحصيلة المؤجّلة في التركيب المؤلَّف. للحلقتين غير الحسّاستين تسلسلات فعل/حالة متطابقة من 16 خطوة رغم ذاكرات مختارة مختلفة. هذا ضابط للقاعدة المحدّدة، لا نتيجة عامة بأن الذاكرة لا يمكن أن تهمّ.

4. ما يحدّده الفرق

أقوى تفسير مدعوم شرطي: تغيير سياسة الاختيار يغيّر المعلومات المقدَّمة إلى هذه القاعدة المستجيبة الثابتة، وفعلها عند القرار 5، والحصيلة اللاحقة المحفوظة. التبعية مهندَسة في القاعدة. ولا يحدّد الناتج تمثيلاً ذاكرياً أسمى بذاته ولا تعلّماً تلقائياً.

تظهر تفصيلة حاسمة في حامل الحداثة المحفوظ. تحوي بايتات الذاكرة المختارة عند القرار 5 الخبرة 3، فعل inspect قراءته البعدية reading: 1، إشارة العائق المرصودة. يحسب المزوّد علماً من مثل هذه الرصدات البعدية، لكن فرع القرارات الأحد عشر المتبقية يفحص stalledCollect بدلاً من ذلك. ولا يستخدم علم العائق ذلك لإطلاق الإزالة عند هذا الحد. وبالتالي لا يمكن وصف ذراع الحداثة الخاسرة بأنها بلا تحذير ذي نفع محتمل. هذه ملاحظة مصدر/سجل مباشرة؛ والقضية بأن سياسة أخرى ستستغل الإشارة تفسير بديل معقول للاختبار، لا تجربة جديدة أُجريت هنا. حامل الحداثة المحفوظ، القاعدة المستجيبة.

للمقارنة غير الحسّاسة أيضاً تصحيح محتفظ به. توقّع ضابط أوّلي حضور/غياب مختلفين لعمليات stalled collect، لكن الذراعين احتفظا بواحد. عني الضابط المصحَّح بخبرات محتفظ بها مختلفة مع مسارات عالم متطابقة. الاحتفاظ بالتوقع الفاشل الأصلي يمنع تحويل قصة ضابط خاطئة إلى نتيجة موجبة. يسجّل سجل الجهاز المقبول ذلك التاريخ.

لا يعزل أي شرط في هذه المجموعة ضرورة التأجيل أو الندرة بتغييرهما. يصف التقرير آلية تعمل بحضورهما. ولا يزعم أن تباين المُنتقي نفسه يعتمد فريداً على أي من السمتين، أو أنه يدوم تحت إخفاقات بالية أو مقدّمات متغيّرة أو سياسات مختلفة أو عوالم غير مفحوصة.

5. التحقق نفسه موضوع شاهد

يشترك تنفيذ المزوّد والإعادة الصارمة في قاعدة مؤلَّفة. يمكن لاتفاقهما أن يُثبت الاتساق بينما يفوته انحراف مشترك عن العقد الموثَّق. قصّرت نسخة خاصة خاطئة محفوظة نافذة الجمع الأخيرة من أربعة قرارات إلى ثلاثة؛ وقبل التحقق الصارم لتلك النسخة الحلقة، بينما أعاد القرار 12 inspect بدلاً من collect المتوقَّع مستقلاً. كانت قاعدة المنتج الأصلية صحيحة. احتياطي الأربعة لسياسة متغيّرة ليس نتيجة سلبية للمُنتقي.

ثم قدّم اختبار إضافي اثني عشر توقعاً حرفياً تغطي القرارات 11 و12 و15، وeffort موجب/صفر، وذاكرة stalled collect فارغة/محتفظاً بها. تسجّل السجلات التاريخية نجاح الضابط غير المعدَّل وفشل ثلاثة متغيرات خاطئة قابلة للترجمة عند التوكيدات المقصودة. في تلقّي هذا البحث طابقت هاشات سجلات التنفيذ الثماني وهاش ملف الاختبار الحالي قيمها المسجّلة، وفُحصت رسائل الاختيار الفاشل ذات الصلة. هذه فحوصات سلامة/قراءة جديدة لشواهد تاريخية، لا اختبارات نُفِّذت للتو. تدقيق القبول، اختبار حرفي، أوامر وسجلات مسجّلة.

طابقت فحوصات البايت الحالية أيضاً ملفات الحلقات المحفوظة الـ140 مع الإيصالات السبعة القائمة، ومدخلات المصدر/الوحدة المؤرشفة الـ95 مع بيان responsive-priority. يدعم هذا سلامة الحزمة المفحوصة. وهو لا يشهد أي ثنائي نُفِّذ أصلاً، ولا يُثبت أن كل مدخل مترجم مؤرشف، ولا يحل محل إعادة إنتاج مستقلة جديدة. يحفظ التقرير حد اكتشاف المصدر الموثَّق: الاستعمال المترجَم يتطلّب استخراج المصدر عند مسار بنائه وبناءً بلا -trimpath. تبقى دعاوى البنية الكاملة واسترداد الانهيار وصحة المستودع كله خارج هذا السجل.

6. شواهد تطوير أسبق منفصلة

تحوي مجموعة بيانات جاهزية الورقة الأقدم ثمانية مسارات مؤلَّفة، و128 لحظة متداخلة، وأربع مقارنات ملامح adaptive/baseline. مقياسها مجموع الاحتياطي المحمول بعد كل ProcessMoment عبر اللحظات 0–15، مقاساً بوحدات احتياطي-لحظة. فروقات adaptive ناقص baseline هي +4 و0 و0 و−1. ليست تدخل priority/recency أعلاه، ولا تشارك طرفه الختامي. تعريفات، أربع مقارنات.

أربع فروقات لملفات تطوير أسبق: current زائد أربعة، shifted صفر، clustered صفر، sparse ناقص واحد. مرّر أفقياً للمعاينة.

Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←

الشكل 2. مقارنات الملفات الثابتة الأربع الأسبق كلها، بمقياسها التراكمي الأصلي. تُحفظ القيم السالبة والصفرية. هذا الشكل سياق تطوير منفصل؛ وليس عيّنة إضافية للشكل 1.

يُفهرس في ذلك التلقّي الأقدم أيضاً تجربتا جدوى تاريخيتان لنموذج محلي وصفّا طوبولوجيا جهاز. لا يمكن إضافة أي منها إلى الشروط الحتمية السبعة لتوسيع عيّنة سلوك. تحتفظ الإعادات والمحاولات وإعادة التسجيل والصفوف المتعددة من مسار واحد بنسبها. لقد فُحصت الملامح الأقدم current وshifted وclustered وsparse ولا تصير حجزاً أعمى بإعادة تسميتها.

7. الموقع في الأدبيات

تجمع أنظمة الذاكرة تدخلات ينبغي تمييزها. يجمع Generative Agents عوامل استرجاع تشمل الحداثة القائمة على الوصول والأهمية والصلة؛ وتستخدم استئصالات المقابلة تواريخ راكمتها البنية كاملة. يدفع ذلك التقييم إلى فصل مسابر قرار التاريخ المشترك عن تدخلات المسار الكامل. وهو لا يصدّق نتيجة هذا الحوض. Park et al., 2023, §§4.1 and 6.1–6.2.

يغيّر Reflexion السياق اللاحق بتغذية راجعة نصية دون تغيير أوزان النموذج الأساس. ويورد ملحق WebShop أيضاً وضعاً لم تتحقق فيه التحسين المحاولة. الآلية وذلك الحد يعارضان معاملة الذاكرة أو التأمل كمنفعة غير مشروطة. وهما يعنيان مهاماً وبُنى تجارب تختلف عن هذا الجهاز. Shinn et al., 2023, abstract and Appendix B.1.

لدراسة تجريبية لاحقة يجب أن يتبع حجم العيّنة هدفاً استدلالياً وافتراضات مبرَّرة. فالتخطيط القائم على الدقة مثلاً يتطلّب عرض فترة مستهدفة وحساباً للتباين؛ ولا تقدّم أي ورقة عدداً كافياً عاماً لتشغيلات ORIGIN. Lakens, 2022, “Planning for Precision”.

إتاحة/وظيفية الأثر والنتائج المستقلة إنجازان منفصلان في اصطلاح آثار ACM. يقدّم هذا التقرير تدقيق سلامة محلياً واشتقاق أشكال قابل للإعادة؛ ولا يدّعي شارة مراجعة ولا تكراراً تجريبياً مستقلاً. ACM SIGIR artifact criteria.

يقيّم LongMemEval استراتيجيات القراءة بشواهد مسترجَعة بوحي، مبيناً أن تصميم القارئ يؤثّر في أداء الأسئلة حتى عند تقديم جلسات الشاهد. يعزّز ذلك التمييز بين الاسترجاع والاستخدام ضمن مهمة أسئلة بتاريخ محادثة. وهو لا يقيس الفعل في عالم دائم. Wu et al., v2, §5.5.

يربط XENON ذاكرة الخبرة بتصحيح التبعية وتصحيح الفعل المرشّح. فهو إذاً مرجع لتدخل يختلف عن تغيير تعريض الحلقة مع تثبيت مختار هذا الجهاز. Lee et al., v3, §§4.1–4.2.

يفصل Vending-Bench حدود السياق الحديث عن أدوات الذاكرة الخارجية بلا قيود تخزين صريحة. وتورد إزالته الأصلية لسعة سياق GPT-4o-mini حصائل أسوأ عند حدود أكبر. يحذّر هذا من معاملة كل طبقة ذاكرة كميزانية واحدة أو افتراض منفعة رتيبة؛ ومجاله التجاري ونماذجه التاريخية ليست نتائج ORIGIN. Backlund and Petersson, v1, §§2.1 and 3.5.2.

يعني تحليل التعلّم المعزّز قليل التشغيل لأغاروال وزملائه بالتباين عبر تشغيلات تدريب/تقييم عشوائية. تتطلّب توصياته الإحصائية بنية عيّنة مناسبة ولا تقدّم فترات ثقة لهذه الشروط المؤلَّفة السبعة. Agarwal et al., NeurIPS 2021.

تبقى نتائج بشرية/غير بشرية وحاسوبية/كمية مدخلات محفظة منفصلة، لا شواهد للنتيجة الحالية. يسجّل فصل المصادر النطاق المقبول وتصحيحات لملخصات جمع أضيق مما ينبغي أو ناقصة.

8. استمرار قابل للتكذيب

يمكن لسؤال تجريبي تالٍ أن يسأل ما إذا كان تباين المُنتقي يغيّر احتمال هدف الحلقة الكاملة لتوزيع معلَن للنموذج/المهمة. يجب أن يبقى الاتجاه مفتوحاً. نتيجة سالبة مفيدة تحتفظ بسجل إخفاق ذي صلة دون تحسين الفعل المختار أو الحصيلة الختامية؛ والنتيجة الضارة أيضاً مُعلِمة. يدفع فحص المصدر الحالي أيضاً إلى تمييز الاحتفاظ عن عقد استخدام الإشارة في قاعدة القرار.

قبل أي جمع، حدّد الرصدات المؤهّلة، والتخزين القابل للنفاذ والتعريض لكل قرار، وقواعد المُنتقي/التعادل/الفيض، والمطالبات المسلَّمة، والنموذج والإصدار المطلوب/المبلّغ، وحدود المورد، وتوزيع العالم/الحالة الابتدائية، والحجز المحمي، والأجل، وتوقعات المسجّل المستقل، ونسب الإخفاق/إعادة المحاولة، وقاعدة التوقّف، والتحليل الأوّلي. طابِق سقوف المورد المسموحة مع الإبلاغ عن الاستهلاك الفعلي. لا تُجبر مسارات العالم/الرصد بعد التدخل على البقاء متساوية؛ فقد تحمل تلك الفروق الأثر المدروس.

استخدم حلقات كاملة وحداتٍ، مع كتل أو أزواج مهام معلَنة. العوالم المشتركة ذات المقيمين المتفاعلين تتطلّب وحدات جماعة/عالم. صرّح بمقام كل الحلقات المطلقة ومعاملة الحصائل غير المتاحة قبل النظر في النتائج. لا تضمن بذرة مشتركة عشوائية نموذج مقابلة بعد تفرّق المسارات. اختر أثراً ذا معنى أو هدفاً للدقة وقيّم حساسية حجم العيّنة تحت افتراضات يمكن الدفاع عنها؛ تبقى هذه الكميات غير مضبوطة هنا. هذه دراسة مقترحة، لا تسجيلاً مسبقاً ولا نتيجة تجريبية مكتملة.

9. إعادة الإنتاج والإتاحة

يبقى المصدر الأساسي وسجلات التشغيل خاصة. تحفظ طبعة القراءة هذه الدعاوى العلمية والقيم المسجّلة للمسودة المراجعة داخلياً. تشير إحالات المصدر والتدقيق المحلية في النص إلى سجلات في تلك الحزمة الخاصة؛ وليست روابط أثر علنية.

أُعيد رسم الشكلين SVG من قيم الاستخراج والمقارنة المقبولة لهذا الموقع. قيم الأشكال متاحة لمعاينة النقاط المرسومة. إعادة بناء شكل تختلف عن إعادة تشغيل العالم. لا تحل هذه القيم المشتقة محل المصدر الأساسي وسجلات الحلقات والمسجّل المستقل.

ما يزال الإصدار البحثي العلني يتطلّب تأليفاً مسؤولاً، وحزمة مصدر/بيانات وتنقيح مجمّدة، وروابط أثر مستقرة، ومراجعة لتلك الحزمة. لم تُعيَّن ولم تُصدَر هنا. تغطي المراجعة الداخلية المكتملة المخطوطة التقنية وأشكالها؛ وليست تحكيماً دورياً ولا تنفيذاً مستقلاً للجهاز. تبقى التصحيحات جزءاً من سجل البحث.

سجل المراجعات

9 أيلول/سبتمبر 2026. طبعة قراءة للموقع من المسودة التقنية المراجعة داخلياً. تُحفظ الدعاوى العلمية والقيم المسجّلة. تُحذف روابط نظام الملفات المحلي؛ ويُعاد رسم الشكلين من القيم المسجّلة نفسها لسطح قراءة داكن. يبقى المصدر وسجلات التشغيل خاصة. هذا ليس إصداراً علنياً للآثار ولا تحكيماً دورياً. تتضمّن واجهات اللغات ترجمة كاملة لطبعة القراءة هذه؛ ويبقى النص الإنجليزي الأصل.