Finite Memory and Delayed Obligations有限记忆与延迟义务有限記憶與延遲義務有限の記憶と遅れて果たされる義務유한한 기억과 지연된 의무Memoria finita y obligaciones diferidasMemoria finita y obligaciones diferidasMemória finita e obrigações adiadasMémoire finie et obligations différéesBegrenztes Gedächtnis und verzögerte VerpflichtungenКонечная память и отложенные обязательстваذاكرة محدودة والتزامات مؤجلة
Original title原题原題原題원제Título originalTítulo originalTítulo originalTitre originalOriginaltitelОригинальное названиеالعنوان الأصليFinite Memory and Delayed Obligations
A recorded software test of resident behavior一份关于居民行为的软件测试报告一份關於居民行為的軟體測試報告住民の行動に関するソフトウェア試験の記録거주자 행동에 대한 소프트웨어 시험 기록Una prueba de software registrada sobre el comportamiento de un residenteUna prueba de software registrada sobre el comportamiento de un residenteUm teste de software registrado do comportamento de um residenteUn test logiciel enregistré du comportement d’un résidentEin aufgezeichneter Softwaretest zum Verhalten eines BewohnersЗаписанный программный тест поведения жителяاختبار برمجي مسجّل لسلوك مقيم
16 min read约 16 分钟約 16 分鐘読了目安 16分읽는 데 약 16분16 min de lectura16 min de lecturaLeitura de 16 min16 min de lecture16 Min. Lesezeit16 минут чтенияقراءة في 16 دقيقةEnglish original由英文原稿译出由英文原稿譯出英語原文の翻訳영어 원문의 번역Traducción del original inglésTraducción del original en inglésTradução do original em inglêsTraduction de l’original anglaisÜbersetzung des englischen OriginalsПеревод с английского оригиналаترجمة عن الأصل الإنجليزيTechnical report · Internal draft技术报告 · 内部草稿技術報告 · 內部草稿テクニカルレポート · 内部ドラフト기술 보고서 · 내부 초안Informe técnico · Borrador internoReporte técnico · Borrador internoRelatório técnico · Rascunho internoRapport technique · Brouillon interneTechnischer Bericht · Interner EntwurfТехнический отчёт · Внутренний черновикتقرير تقني · مسودة داخلية
Abstract
Limited memory can change an agent's future actions, but storing a past failure does not establish learning or guarantee that the information will be used. We examine an existing ORIGIN apparatus in which two deterministic selectors expose different past experiences to a fixed decision rule. One resident acts in an authored resource-constrained catchment for 16 decisions and must finish with at least five reserve units. Both selectors permit two records and at most 8192 canonical UTF-8 bytes. The archived responsive-priority episode reaches the obligation; its recency counterpart does not. Two controls that ignore selected memory follow identical action/state sequences and both miss the obligation. The decisive dependency is explicitly authored: recency retains an observed obstruction cue, but the rule's decision-5 branch responds specifically to a remembered stalled collect. The report therefore documents a bounded mechanism and its verification limits. It does not estimate a population effect or demonstrate LLM learning, motivation, survival, or cross-species equivalence. We preserve separate null/adverse development comparisons and specify what a later empirical study would need.
Terms
ORIGIN
Proper name of the project. Not translated.
Sol-III
Proper name of the authored catchment world. Not translated.
delayed obligation
A requirement scored only after decision 15: final reserve at least five. Crossing five earlier is not completion.
stalled collect
A collect action followed by no visible increase in reserve, including a decrease. The selector predicate; it does not name a hidden cause. Source identifier: stalledCollect.
selector
The policy that chooses which archived records a resident may see. Here: priority versus recency, each capped at two records and 8192 UTF-8 bytes.
apparatus
The completed deterministic fixture already on record: world, selectors, provider, verifier, and saved episodes. This report reads it; it does not rerun it.
resident
The acting agent in the catchment. It is not a biological organism and zero reserve is not death.
reserve
The finite resource counter in the authored world. The delayed obligation requires final reserve ≥ 5.
1. The question and the evidence
The research question is whether prioritizing a resident's own observed failed-action experiences over recent experiences, at the same memory capacity, changes completion of a delayed obligation—and under which conditions remembering those experiences leaves behavior unchanged. The present answer is limited to an already completed deterministic apparatus. It is useful because selected information, rule-dependent action, authoritative world change, and outcome can be examined separately.
The apparatus was completed before this research intake. This report reads its source, accepted records, seven saved episodes, and derived decision table. It adds a source/record audit and figures derived from those saved data. It does not execute the world, a Go test or verifier, a live model, or a hardware experiment. Four external research memos supplied candidate questions and sources; their answers are not empirical evidence. The companion claim/source table distinguishes original findings, local observations, hypotheses, and unverified leads.
“Failure” requires an operational definition. The selector's predicate is a collect action followed by no visible increase in reserve, including a decrease. It does not identify a concealed causal explanation or assert that the action was rejected. “Delayed” refers to consequences of earlier actions that affect later resource availability and to an obligation evaluated only after decision 15. “Long-term” denotes this finite horizon; it does not mean indefinite deployment. These definitions follow the implemented selector and apparatus contract.
2. The completed apparatus
The existing Sol-III current catchment is an authored, dimensionless world. Its source defines initial reserve 4, effort 1, stored resource 2, and an obstruction. Reserve, effort, and store have finite caps. The resident chooses among inspect, collect, clear, and rest. Clearing changes the obstacle state and thereby later rain capture. Current perception exposes reserve, effort, and an observation reading; it does not directly expose every world variable. The resource and lifecycle declarations do not turn zero reserve into death: residents can continue acting at zero. The measured endpoint is therefore provisioning at a deadline, not survival. These are source-level descriptions of world.go, not claims of biological realism.
Every memory record binds one resident's actual pre-action perception, its chosen action, and the delivered post-action perception to an episode/run lineage. Only complete prior records are eligible. The priority selector first ranks collects with non-positive observed reserve change, then fills by recency. The comparator ranks by recency alone. Both return selected records chronologically, skip oversized candidates, and cap the entire selected array at two records and 8192 bytes. Selection does not update model weights. The host retains the larger archive and omission evidence; the resident-facing memory budget applies to the selected exposure, not to total computer storage.
Both responsive arms use the same stateless authored provider. Its rule has an explicit clock: at decision 5, corresponding to eleven remaining decisions including the current one, it clears only if visible effort is at least three and selected memory contains a stalled collect. It rests through the middle interval and collects with positive effort during the final four decisions. Other earlier branches respond to memory and current perception. Thus the experiment does not ask a model to discover a strategy. The provider source makes the dependency inspectable.
Two insensitive controls collect when current effort is positive and otherwise rest, without using selected memory. Three literal schedules check a successful path, that path with decision-5 clearing replaced by rest, and all-rest behavior. The delayed goal is satisfied only when a complete, valid 16-decision episode has final reserve at least five. Crossing five earlier is insufficient.
The recorded verifier reconstructs correspondence among manifests, journals, attempts, requests, selected memories, actions, observations, and final facts before scoring. It is provider-free; the resident itself still uses an authored provider. A valid missed obligation is distinct from invalid or incomplete evidence. This distinction prevents a goal failure from being silently discarded as an invalid record and prevents a well-formed trace from being mistaken for a successful outcome.
3. Results in the saved conditions
The seven recorded conditions each contain 16 decisions. Their 112 decision rows are nested measurements, not 112 independent samples. The following values were read from saved run/verification summaries and checked against the corresponding extracted final states. They are descriptive fixed-condition results, with no sampling-based interval or p-value. Saved results, decision extraction.
Condition
Final reserve
Terminal obligation
responsive-priority
5
Met
responsive-recency
0
Missed
insensitive-priority
0
Missed
insensitive-recency
0
Missed
literal-success-priority
5
Met
literal-no-clear-priority
0
Missed
literal-all-rest-priority
0
Missed
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Figure 1. Existing authored trajectories. The responsive pair differs at the clearing decision and later in reserve. The insensitive pair has identical actions and states. The requirement applies only at decision 15; reserve five at decision zero is not completion. Lines connect recorded decision states and do not denote additional observations.
At decision 5, priority retains experiences [1,4] and clears; recency retains [3,4] and rests. Their selected memory arrays contain 2693 and 2692 bytes respectively, and captured Petition JSON sizes are 5039 and 5038 bytes. Equal capacity limits therefore do not imply identical byte counts or LLM token costs. These are bytes, not tokenizer measurements. The source and saved selection establish a two-record bottleneck at this boundary; they do not establish a binding 8192-byte bottleneck.
The two responsive episodes end with reserve 5 and 0. Their literal counterparts yield the same reserve trajectories; replacing clearing with rest changes the delayed outcome in the authored fixture. The two insensitive episodes have identical 16-step action/state sequences despite different selected memories. This is a control for the specified decision rule, not a general result that memory cannot matter.
4. What the difference identifies
The strongest supported interpretation is conditional: changing the selection policy changes the information supplied to this fixed responsive rule, its decision-5 action, and the saved downstream outcome. The dependence is engineered into the rule. The result does not identify an intrinsically superior memory representation or spontaneous learning.
A critical detail is visible in the saved recency carrier. Its decision-5 selected-memory bytes include experience 3, an inspect action whose post-observation has reading: 1, the observed obstruction signal. The provider computes a flag from such post-observations, but the eleven-remaining-decisions branch checks stalledCollect instead. It does not use that obstruction flag to trigger clearing at this boundary. Consequently, the losing recency arm cannot be described as having no potentially useful warning. This is a direct source/record observation; the proposition that another policy would exploit the cue is a plausible alternative explanation to test, not a new experiment performed here. Saved recency carrier, responsive rule.
The insensitive comparison also has a retained correction. An initial control expected different presence/absence of stalled collects, but both arms retained one. The corrected control concerned different retained experiences with identical world trajectories. Retaining the original failed expectation prevents a mistaken control story from being converted into a positive result. The accepted apparatus record documents that history.
No condition in this set isolates the necessity of delay or scarcity by varying them. The report describes a mechanism operating in their presence. It does not claim the same selector contrast depends uniquely on either feature, or that it persists under obsolete failures, changed prerequisites, different policies, or unexamined worlds.
5. Verification is itself an object of evidence
Provider execution and strict replay share an authored rule. Their agreement can establish consistency while missing a shared deviation from the documented contract. A preserved private wrong variant shortened the final collection window from four decisions to three; that copy's strict verification accepted the episode, while decision 12 returned inspect rather than the independently expected collect. The original product rule was correct. The changed-policy reserve of four is not an adverse selector result.
An additive test then supplied twelve literal expectations spanning decisions 11, 12, and 15, positive/zero effort, and empty/retained stalled-collect memory. Historical logs record the unmodified control passing and three compiling wrong variants failing the intended assertions. In this research intake, all eight implementation log hashes and the current test-file hash matched their recorded values, and the relevant failing-choice messages were inspected. These are fresh integrity/reading checks of historical evidence, not freshly executed tests. Acceptance audit, literal test, recorded commands and logs.
Current byte checks also matched all 140 saved episode files against the seven existing receipts and all 95 archived source/module entries against the responsive-priority manifest. This supports integrity of the inspected package. It does not attest which binary originally executed, establish that every compiler input is archived, or replace a fresh independent reproduction. The report preserves the documented source-discovery limitation: compiled use requires the source checkout at its build path and a build without -trimpath. Full infrastructure, crash-recovery, and repository-wide correctness claims remain outside this record.
6. Separate earlier development evidence
The older paper-readiness dataset contains eight authored trajectories, 128 nested moments, and four adaptive/baseline profile comparisons. Its metric is the sum of carried reserve after each ProcessMoment over moments 0–15, measured in reserve-unit moments. The adaptive-minus-baseline differences are +4, 0, 0, and −1. They are not the priority/recency intervention above, and they do not share its terminal endpoint. Definitions, four comparisons.
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Figure 2. All four earlier fixed profile comparisons, using their original cumulative metric. The adverse and zero values are retained. This figure is separate development context; it is not additional sampling for Figure 1.
Two historical local-model feasibility trials and two apparatus-topology rows are also catalogued in that older intake. None can be added to the seven deterministic conditions to enlarge a behavioral sample. Replays, retries, rescoring, and multiple rows from one trajectory retain their lineage. The older current, shifted, clustered, and sparse profiles have already been inspected and cannot become a blind holdout by renaming them.
7. Position in the literature
Memory systems combine interventions that should be distinguished. Generative Agents combines retrieval factors including access-based recency, importance, and relevance; its interview ablations use histories accumulated by the full architecture. That evaluation motivates separating common-history decision probes from complete trajectory interventions. It does not validate this catchment result. Park et al., 2023, §§4.1 and 6.1–6.2.
Reflexion changes subsequent context through textual feedback rather than changing base-model weights. Its WebShop appendix also reports a setting in which the attempted improvement did not materialize. Both the mechanism and that limitation argue against treating memory or reflection as an unconditional benefit. They concern different tasks and trial structures from this apparatus. Shinn et al., 2023, abstract and Appendix B.1.
For a later empirical study, sample size must follow an inferential objective and justified assumptions. Precision-based planning, for example, requires a target interval width and an account of variability; no paper supplies a universal sufficient number of ORIGIN runs. Lakens, 2022, “Planning for Precision”.
Artifact availability/functionality and independently obtained results are separate achievements in ACM's artifact terminology. This report offers a local integrity audit and a reproducible figure derivation; it does not claim a review badge or an independent experimental replication. ACM SIGIR artifact criteria.
LongMemEval evaluates reading strategies with oracle-retrieved evidence, showing that reader design affects QA performance even when the evidence sessions are supplied. This strengthens the distinction between retrieval and use, within a chat-history QA task. It does not measure persistent-world action. Wu et al., v2, §5.5.
XENON couples experience memory to dependency correction and candidate-action correction. It is therefore a reference for a different intervention from changing episode exposure while keeping this apparatus's chooser fixed. Lee et al., v3, §§4.1–4.2.
Vending-Bench separates recent-context limits from external memory tools without explicit storage constraints. Its original GPT-4o-mini context-capacity ablation reports worse outcomes with larger limits. This cautions against treating every memory layer as one budget or assuming monotonic benefit; its business domain and historical models are not ORIGIN results. Backlund and Petersson, v1, §§2.1 and 3.5.2.
The few-run RL analysis by Agarwal and colleagues concerns variability across stochastic training/evaluation runs. Its statistical recommendations require an appropriate sampling structure and do not supply confidence intervals for these seven authored conditions. Agarwal et al., NeurIPS 2021.
Human/nonhuman and compute/quantum findings remain separate portfolio inputs, not evidence for the present result. The source adjudication records the admitted scope and corrections to over-narrow or incomplete collection summaries.
8. A falsifiable continuation
A next empirical question could ask whether the selector contrast changes complete-episode goal probability for a declared model/task distribution. The direction must remain open. A useful negative result would retain a relevant failure record without improving the chosen action or terminal outcome; a harmful result would also be informative. The present source inspection additionally motivates distinguishing retention from the decision rule's cue-use contract.
Before any collection, define the eligible observations, accessible storage and per-decision exposure, selector/tie/overflow rules, delivered prompts, model and requested/reported version, resource limits, world/initial-state distribution, protected holdout, deadline, independent scorer expectations, failure/retry lineage, stopping rule, and primary analysis. Match the permitted resource ceilings while reporting actual consumption. Do not force post-intervention world/observation trajectories to remain equal; those differences may carry the effect being studied.
Use complete episodes as units, with declared task blocks or pairs. Shared worlds with interacting residents require group/world units. State the denominator for all launched episodes and the treatment of unavailable outcomes before looking at results. A common seed does not guarantee corresponding model randomness after trajectories diverge. Choose a meaningful effect or precision target and assess sample-size sensitivity under defensible assumptions; these quantities remain unset here. This is a proposed study, not a preregistration or a completed empirical result.
9. Reproduction and availability
The underlying source and runtime records remain private. This reading edition preserves the internally reviewed draft's scientific claims and recorded values. Local source and audit references in the text name records in that private package; they are not public artifact links.
The two SVG figures are redrawn from the accepted extraction and comparison values for this website. Figure values are available for inspecting the plotted points. Rebuilding a figure is different from replaying the world. These derived values do not replace the underlying source, episode records, and independent scorer.
A public research release still requires accountable authorship, a frozen source/data and redaction bundle, stable artifact links, and review of that release package. Those have not been assigned or released here. The completed internal review covers the technical manuscript and its figures; it is not journal peer review or independent apparatus execution. Corrections remain part of the research record.
Revision history
9 September 2026. Website reading edition of the internally reviewed technical draft. The scientific claims and recorded values are retained. Local filesystem links are omitted; the two figures are redrawn from the same recorded values for a dark reading surface. Source and runtime records remain private. This is not a public artifact release or journal peer review. Interface locales include a complete translation of this reading edition; the English text remains the original.
七个已记录条件各含 16 次决策。其 112 行决策是嵌套测量,不是 112 个独立样本。下列数值读自已保存的运行/校验摘要,并对照相应抽出的终态核对。它们是描述性的固定条件结果,没有基于抽样的区间或 p 值。已保存结果,决策抽出。
条件
终末储备
终末义务
responsive-priority
5
达成
responsive-recency
0
未达成
insensitive-priority
0
未达成
insensitive-recency
0
未达成
literal-success-priority
5
达成
literal-no-clear-priority
0
未达成
literal-all-rest-priority
0
未达成
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
记忆系统把应当区分的干预叠在一起。Generative Agents 组合包括基于访问的近因、重要性与相关性在内的检索因子;其访谈消融使用完整架构累积的历史。该评价促使把共同历史的决策探针与完整轨迹干预分开。它并不验证本流域结果。Park et al., 2023, §§4.1 and 6.1–6.2。
七個已記錄條件各含 16 次決策。其 112 行決策是嵌套測量,不是 112 個獨立樣本。下列數值讀自己保存的運行/校驗摘要,並對照相應抽出的終態核對。它們是描述性的固定條件結果,沒有基於抽樣的區間或 p 值。已保存結果,決策抽出。
條件
終末儲備
終末義務
responsive-priority
5
達成
responsive-recency
0
未達成
insensitive-priority
0
未達成
insensitive-recency
0
未達成
literal-success-priority
5
達成
literal-no-clear-priority
0
未達成
literal-all-rest-priority
0
未達成
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
記憶系統把應當區分的干預疊在一起。Generative Agents 組合包括基於訪問的近因、重要性與相關性在內的檢索因子;其訪談消融使用完整架構累積的歷史。該評價促使把共同歷史的決策探針與完整軌跡干預分開。它並不驗證本流域結果。Park et al., 2023, §§4.1 and 6.1–6.2。
記録された七条件は各16決定を含む。112行の決定は入れ子の測定であり、112の独立標本ではない。次の値は保存された実行/検証要約から読み、対応する抽出終状態と照合した。標本に基づく区間も p 値もない、記述的な固定条件の結果である。保存結果、決定抽出。
条件
終端の備蓄
終端の義務
responsive-priority
5
達成
responsive-recency
0
未達
insensitive-priority
0
未達
insensitive-recency
0
未達
literal-success-priority
5
達成
literal-no-clear-priority
0
未達
literal-all-rest-priority
0
未達
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
記憶システムは区別すべき介入を組み合わせる。Generative Agents はアクセス近因・重要度・関連を含む検索因子を組み合わせ、面接アブレーションは全アーキテクチャが蓄積した履歴を使う。その評価は、共通履歴の決定プローブと完全軌跡介入を分ける動機になる。本集水域の結果を検証しない。Park et al., 2023, §§4.1 and 6.1–6.2。
유한한 기억은 주체의 이후 행동을 바꿀 수 있지만, 과거의 실패를 저장했다고 해서 학습이 성립하거나 그 정보가 쓰이리라는 보장은 없다. 기존의 ORIGIN 실험 장치 [apparatus]를 검토한다. 두 결정론적 선택기 [selector]가 고정된 결정 규칙에 서로 다른 과거 경험을 보여 준다. 한 거주자가 작성된 자원 제약 집수에서 16번 행동하며, 끝날 때 비축이 적어도 다섯 단위여야 한다. 두 선택기 모두 기록 2건, 정규 UTF-8 최대 8192바이트다. 보관된 responsive-priority 에피소드는 의무에 도달하고, 그 최근성 대조는 도달하지 않는다. 선택된 기억을 무시하는 두 통제는 동일한 행동/상태 수열을 따르며 둘 다 의무를 놓친다. 결정적 의존은 명시적으로 작성되어 있다. 최근성은 관측된 장애 단서를 유지하지만, 규칙의 결정 5 분기는 기억된 정체 수집 [stalled collect]에만 반응한다. 따라서 이 보고서는 유계 메커니즘과 그 검증 한계를 기록한다. 모집단 효과를 추정하지 않으며 LLM 학습, 동기, 생존, 종 간 동등도 보이지 않는다. 별도의 영/부정 개발 비교를 보존하고, 이후 경험 연구에 필요한 것을 명시한다.
용어
ORIGIN
프로젝트 고유명. 번역하지 않는다.
Sol-III
작성된 집수 세계의 고유명. 번역하지 않는다.
지연 의무 [delayed obligation]
결정 15 이후에만 채점되는 요건. 최종 비축이 5 이상. 그 전에 5를 넘어도 완료가 아니다.
정체 수집 [stalled collect]
수집 이후 비축의 가시적 증가가 없는 경우(감소 포함). 선택기 술어이며 숨은 원인을 지칭하지 않는다. 소스 식별자: stalledCollect.
선택기 [selector]
거주자가 볼 수 있는 아카이브 기록을 고르는 정책. 여기서는 priority 대 recency. 각각 기록 2건, UTF-8 8192바이트 상한.
실험 장치 [apparatus]
이미 기록된 결정론적 장치. 세계, 선택기, 제공기, 검증기, 저장된 에피소드. 이 보고서는 그것을 읽을 뿐 다시 실행하지 않는다.
거주자 [resident]
집수에서 행위하는 주체. 생물이 아니며 비축 0은 죽음이 아니다.
비축 [reserve]
작성된 세계의 유한 자원 카운터. 지연 의무는 최종 비축 ≥ 5를 요구한다.
1. 질문과 증거
연구 질문은 같다. 같은 기억 용량에서 거주자 자신이 관측한 실패 행동 경험을 최근 경험보다 우선하는 것이 지연 의무의 완료를 바꾸는가, 그리고 그 경험을 기억해도 행동이 그대로인 조건은 무엇인가. 현재의 답은 이미 완료된 결정론적 장치에 한정된다. 선택된 정보, 규칙에 의존하는 행동, 권위 있는 세계 변화, 결과를 따로 볼 수 있어 유용하다.
장치는 이번 연구 접수 이전에 완료되었다. 이 보고서는 소스, 수리된 기록, 저장된 에피소드 일곱, 파생 결정표를 읽는다. 소스/기록 감사와 그 저장 데이터에서 그린 그림을 더한다. 세계, Go 테스트나 검증기, 살아있는 모델, 하드웨어 실험은 실행하지 않는다. 외부 연구 메모 네 편이 후보 질문과 출처를 공급했으나 그 답은 경험 증거가 아니다. 동반 주장/출처 표는 독창 발견, 국소 관찰, 가설, 미검증 단서를 구별한다.
「실패」에는 조작적 정의가 필요하다. 선택기의 술어는 collect 이후 비축의 가시적 증가가 없는 것(감소 포함)이다. 숨은 인과 설명을 특정하지 않으며 행위가 거부되었다고 주장하지 않는다. 「지연」은 이후 자원 가용성에 영향을 주는 앞선 행위의 결과와, 결정 15 이후에만 평가되는 의무를 가리킨다. 「장기」는 이 유한 지평이며 무기한 배치가 아니다. 이 정의는 구현된 선택기와 장치 계약을 따른다.
2. 완료된 장치
기존의 Sol-III current 집수는 작성된 무차원 세계다. 소스는 초기 비축 4, effort 1, 저장된 자원 2, 장애를 정한다. 비축, effort, 저장에는 유한 상한이 있다. 거주자는 inspect, collect, clear, rest 중에서 고른다. clear는 장애 상태를 바꿔 이후 빗물 포획을 바꾼다. 현재 지각은 비축, effort, 관측 수치를 보이며 모든 세계 변수를 직접 보이지는 않는다. 자원과 생애주기 선언은 비축 0을 죽음으로 만들지 않는다. 거주자는 0에서도 계속 행동할 수 있다. 측정 종점은 기한의 보급이며 생존이 아니다. 이는 world.go의 소스 수준 서술이며 생물학적 실재의 주장이 아니다.
각 기억 기록은 한 거주자의 실제 행동 전 지각, 고른 행동, 전달된 행동 후 지각을 에피소드/실행 계보에 묶는다. 완전한 선행 기록만 적격이다. priority 선택기는 관측된 비축 변화가 비양인 collect를 먼저 순위한 뒤 최근성으로 채운다. 비교기는 최근성만으로 순위한다. 둘 다 선택된 기록을 시간순으로 반환하고, 과도한 후보를 건너뛰며, 선택 배열 전체를 기록 2건·8192바이트로 제한한다. 선택은 모델 가중치를 갱신하지 않는다. 호스트는 더 큰 아카이브와 생략 증거를 보유한다. 거주자 대면 기억 예산은 선택된 노출에 적용되며 컴퓨터 총저장이 아니다.
반응 팔 둘은 같은 무상태 작성 제공기를 쓴다. 규칙에는 명시적 시계가 있다. 결정 5(현재를 포함한 남은 11결정)에서는 가시 effort가 3 이상이고 선택 기억에 정체 수집이 있을 때만 clear한다. 중간 구간은 rest하고, 마지막 네 결정에서는 양의 effort로 collect한다. 더 이른 다른 분기는 기억과 현재 지각에 반응한다. 따라서 실험은 모델에게 전략 발견을 요구하지 않는다. 제공기 소스가 그 의존을 검사 가능하게 한다.
두 insensitive 통제는 현재 effort가 양이면 collect, 아니면 rest하며 선택된 기억을 쓰지 않는다. 세 문자 일정은 성공 경로, 결정 5의 clear를 rest로 바꾼 그 경로, 전부 rest를 점검한다. 지연 목표는 완전하고 유효한 16결정 에피소드의 최종 비축이 5 이상일 때만 충족된다. 그 전에 5를 넘어도 부족하다.
기록된 검증기는 채점 전에 매니페스트, 일지, 시도, 요청, 선택 기억, 행동, 관측, 종국 사실 사이의 대응을 재구성한다. 제공기 비의존이다. 거주자 자신은 여전히 작성된 제공기를 쓴다. 유효한 미충족 의무는 무효하거나 불완전한 증거와 다르다. 이 구분은 목표 실패를 무효 기록으로 조용히 버리는 것과, 형식이 갖춰진 추적을 성공 결과로 오인하는 것을 막는다.
3. 저장된 조건의 결과
기록된 일곱 조건은 각 16결정을 담는다. 112행의 결정은 중첩 측정이며 112개의 독립 표본이 아니다. 다음 값은 저장된 실행/검증 요약에서 읽고 대응 추출 종국 상태와 대조했다. 표본 기반 구간이나 p값이 없는, 기술적인 고정 조건 결과다. 저장 결과, 결정 추출.
조건
최종 비축
종단 의무
responsive-priority
5
충족
responsive-recency
0
미충족
insensitive-priority
0
미충족
insensitive-recency
0
미충족
literal-success-priority
5
충족
literal-no-clear-priority
0
미충족
literal-all-rest-priority
0
미충족
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
그림 1. 기존에 작성된 궤적. 반응형 쌍은 제거 결정과 이후 비축에서 갈라진다. 비의존 쌍의 행동과 상태는 동일하다. 요건은 결정 15에만 적용되며, 결정 0에서 비축이 5여도 완료가 아니다. 선은 기록된 결정 상태를 이을 뿐 추가 관측을 뜻하지 않는다.
결정 5에서 priority는 경험 [1,4]를 유지하고 clear하며, recency는 [3,4]를 유지하고 rest한다. 선택 기억 배열은 각각 2693과 2692바이트이고, 포착된 Petition JSON 크기는 5039과 5038바이트다. 따라서 같은 용량 상한이 동일한 바이트 수나 LLM 토큰 비용을 뜻하지는 않는다. 이는 바이트이며 토크나이저 측정이 아니다. 소스와 저장된 선택은 이 경계에서 기록 2건의 병목을 확립한다. 구속력 있는 8192바이트 병목은 확립하지 않는다.
두 반응 에피소드는 비축 5와 0으로 끝난다. 문자 대응은 같은 비축 궤적을 낸다. 작성된 장치에서 clear를 rest로 바꾸면 지연 결과가 바뀐다. 두 비의존 에피소드는 선택된 기억이 다른데도 16보 행동/상태 수열이 동일하다. 이는 지정된 결정 규칙에 대한 통제이지, 기억이 작용할 수 없다는 일반 결과가 아니다.
4. 차이가 식별하는 것
가장 강하게 지지되는 해석은 조건적이다. 선택 정책을 바꾸면 이 고정 반응 규칙에 공급되는 정보, 결정 5의 행동, 저장된 하류 결과가 바뀐다. 의존은 규칙에 설계되어 있다. 결과는 본질적으로 우월한 기억 표상이나 자발 학습을 식별하지 않는다.
저장된 최근성 운반체에 결정적 세부가 보인다. 결정 5의 선택 기억 바이트는 경험 3을 포함한다. inspect이며 사후 관측은 reading: 1, 관측된 장애 신호다. 제공기는 그런 사후 관측에서 깃발을 계산하지만, 남은 11결정 분기는 대신 stalledCollect를 본다. 이 경계에서 그 장애 깃발로 clear를 촉발하지 않는다. 따라서 패배한 최근성 팔을 잠재적으로 유용한 경고가 없었다고 말할 수 없다. 이는 직접적인 소스/기록 관찰이다. 다른 정책이 그 단서를 쓴다는 명제는 여기서 새로 수행한 실험이 아니라, 검증할 타당한 대안 설명이다. 저장 최근성 운반체, 반응 규칙.
비의존 비교에도 유지된 교정이 있다. 초기 통제는 정체 수집의 유무가 다를 것으로 기대했으나 두 팔 모두 하나를 유지했다. 교정된 통제는 동일한 세계 궤적에서 유지 경험이 다른 것이었다. 원래의 실패한 기대를 남기면 잘못된 통제 이야기가 양성 결과로 바뀌는 것을 막는다. 수리된 장치 기록이 그 이력을 남긴다.
이 집합의 어떤 조건도 지연이나 희소를 바꿔 그 필요성을 분리하지 않는다. 보고서는 그것들이 있는 상태에서 작동하는 메커니즘을 서술한다. 같은 선택기 대비가 어느 한 특징에만 의존한다거나, 낡은 실패, 바뀐 전제, 다른 정책, 미검토 세계에서 지속된다고 주장하지 않는다.
5. 검증 자체가 증거의 대상이다
제공기 실행과 엄격 재생은 작성된 규칙을 공유한다. 일치는 일관성을 세우면서도 문서화된 계약에서의 공유 일탈을 놓칠 수 있다. 보존된 사적 오류 변종은 최종 수집 창을 4결정에서 3으로 줄였다. 그 사본의 엄격 검증은 에피소드를 수리했지만, 결정 12는 독립적으로 기대된 collect가 아니라 inspect를 반환했다. 원래 제품 규칙은 옳았다. 정책 변경 후 비축 4는 선택기의 부정 결과가 아니다.
가산 테스트는 결정 11·12·15, 양/영 effort, 빈/유지 정체 수집 기억에 걸친 문자 기대 열둘을 공급했다. 역사 로그는 미수정 통제의 통과와, 의도한 어서션에 실패한 컴파일 가능한 오류 변종 셋을 기록한다. 이번 연구 접수에서 구현 로그 해시 여덟과 현재 테스트 파일 해시가 모두 기록값과 일치했고, 관련 실패 선택 메시지를 검사했다. 이는 역사 증거의 새 무결성/열람 점검이며 새로 실행한 테스트가 아니다. 수리 감사, 문자 테스트, 기록된 명령과 로그.
현재 바이트 점검은 저장된 에피소드 파일 140개를 기존 영수증 일곱과, 아카이브된 소스/모듈 항목 95개를 responsive-priority 매니페스트와 맞췄다. 검사한 꾸러미의 무결성을 지지한다. 원래 실행된 바이너리가 무엇인지를 증언하지 않고, 모든 컴파일러 입력이 아카이브되었음을 세우지 않으며, 새 독립 재현을 대체하지 않는다. 보고서는 문서화된 소스 발견 한계를 남긴다. 컴파일 사용은 빌드 경로의 소스 체크아웃과 -trimpath 없는 빌드를 요구한다. 전체 기반, 충돌 복구, 저장소 전역 올바름 주장은 이 기록 밖이다.
6. 별도의 이전 개발 증거
더 오래된 논문 준비 데이터셋은 작성 궤적 여덟, 중첩 시각 128, adaptive/baseline 프로파일 비교 넷을 담는다. 지표는 각 ProcessMoment 이후 휴대 비축을 시각 0–15에서 합한 것으로, 비축 단위·시각으로 잰다. adaptive 빼기 baseline 차이는 +4, 0, 0, −1이다. 위의 priority/recency 개입이 아니며 종단점도 공유하지 않는다. 정의, 네 비교.
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
그림 2. 이전의 고정 프로파일 비교 네 건 전부. 원래의 누적 지표를 쓴다. 음수와 0은 유지한다. 이 그림은 별도의 개발 맥락이며 그림 1의 추가 표본이 아니다.
그 이전 접수에는 역사적 로컬 모델 타당성 시험 둘과 장치 위상 행 둘도 목록된다. 어느 것도 일곱 결정론 조건에 더해 행동 표본을 넓힐 수 없다. 재생, 재시도, 재채점, 한 궤적의 여러 행은 계보를 유지한다. 이전 current, shifted, clustered, sparse 프로파일은 이미 검사되었고, 이름만 바꿔 맹검 홀드아웃이 될 수 없다.
7. 문헌에서의 위치
기억 시스템은 구별해야 할 개입을 결합한다. Generative Agents는 접근 기반 최근성, 중요도, 관련성을 포함한 검색 인자를 결합하며, 면담 제거는 전체 구조가 쌓은 이력을 쓴다. 그 평가는 공통 이력 결정 탐침과 완전 궤적 개입을 나누는 동기가 된다. 이 집수 결과를 검증하지 않는다. Park et al., 2023, §§4.1 and 6.1–6.2.
Reflexion은 기저 모델 가중치를 바꾸지 않고 텍스트 피드백으로 이후 맥락을 바꾼다. WebShop 부록은 시도한 개선이 나타나지 않은 설정도 보고한다. 메커니즘과 그 한계 모두 기억이나 성찰을 무조건 이득으로 다루는 데 반대한다. 이 장치와는 다른 과제와 시행 구조다. Shinn et al., 2023, abstract and Appendix B.1.
ACM의 산출물 용어에서 산출물 가용성/기능과 독립적으로 얻은 결과는 별개의 성취다. 이 보고서는 국소 무결성 감사와 재현 가능한 그림 도출을 제공한다. 심사 배지나 독립 실험 재현을 주장하지 않는다. ACM SIGIR artifact criteria.
LongMemEval은 신탁 검색 증거로 읽기 전략을 평가하며, 증거 세션이 주어져도 독자 설계가 QA 성능에 영향을 줌을 보인다. 채팅 이력 QA 과제 안에서 검색과 사용의 구분을 강화한다. 지속 세계 행동은 측정하지 않는다. Wu et al., v2, §5.5.
XENON은 경험 기억을 의존 교정과 후보 행동 교정에 결합한다. 따라서 이 장치의 선택기를 고정한 채 에피소드 노출을 바꾸는 것과는 다른 개입의 참조다. Lee et al., v3, §§4.1–4.2.
Vending-Bench는 최근 맥락 한계를 명시적 저장 제약 없는 외부 기억 도구와 나눈다. 원래 GPT-4o-mini 맥락 용량 제거는 더 큰 한계에서 더 나쁜 결과를 보고한다. 모든 기억 층을 하나의 예산으로 다루거나 단조 이득을 가정하지 말라는 경고다. 그 업무 영역과 역사 모델은 ORIGIN 결과가 아니다. Backlund and Petersson, v1, §§2.1 and 3.5.2.
Agarwal와 동료들의 소수 실행 강화학습 분석은 확률적 훈련/평가 실행 간 변동을 다룬다. 통계 권고는 적절한 표본 구조를 요구하며 이 일곱 작성 조건에 신뢰구간을 주지 않는다. Agarwal et al., NeurIPS 2021.
인간/비인간 및 계산/양자 발견은 별도 포트폴리오 입력이며 현재 결과의 증거가 아니다. 소스 재결은 인정된 범위와 너무 좁거나 불완전한 수집 요약에 대한 교정을 기록한다.
8. 반증 가능한 후속
다음 경험 질문은 선언된 모델/과제 분포에서 선택기 대비가 완전 에피소드 목표 확률을 바꾸는지일 수 있다. 방향은 열려 있어야 한다. 유용한 음성 결과는 관련 실패 기록을 유지하면서 고른 행동이나 종단 결과를 개선하지 않는 것이다. 해로운 결과 또한 정보가 된다. 현재의 소스 검사는 유지와 결정 규칙의 단서 사용 계약을 나누는 동기를 더한다.
어떤 수집 전에 적격 관측, 접근 가능한 저장과 결정별 노출, 선택기/동점/넘침 규칙, 전달 프롬프트, 모델과 요청/보고 버전, 자원 한계, 세계/초기 상태 분포, 보호 홀드아웃, 기한, 독립 채점 기대, 실패/재시도 계보, 정지 규칙, 주분석을 정한다. 허용 자원 상한을 맞추면서 실제 소비를 보고한다. 개입 후 세계/관측 궤적을 같게 강제하지 말라. 그 차이가 연구 중인 효과를 나를 수 있다.
완전 에피소드를 단위로 쓰고, 과제 블록이나 쌍을 선언하라. 상호작용하는 거주자의 공유 세계는 집단/세계 단위가 필요하다. 결과를 보기 전에 시작한 모든 에피소드의 분모와 얻을 수 없는 결과의 처리를 밝혀라. 공통 시드는 궤적이 갈라진 뒤 모델 난수가 대응함을 보장하지 않는다. 의미 있는 효과 또는 정밀 목표를 고르고, 방어 가능한 가정 아래에서 표본 크기 민감도를 평가하라. 이 양은 여기서 미설정이다. 이는 제안 연구이며 사전등록도, 완료된 경험 결과도 아니다.
9. 재현과 이용 가능성
기저 소스와 런타임 기록은 사적으로 남는다. 이 열람판은 내부 심사를 거친 초안의 과학 주장과 기록값을 보존한다. 본문의 국소 소스와 감사 지칭은 그 사적 꾸러미의 기록을 가리킨다. 공개 산출물 링크가 아니다.
두 SVG 그림은 이 사이트를 위해 수리된 추출·비교 값에서 다시 그렸다. 그림 값으로 그린 점을 검사할 수 있다. 그림을 다시 그리는 것은 세계를 재생하는 것과 다르다. 이 파생 값은 기저 소스, 에피소드 기록, 독립 채점기를 대체하지 않는다.
공개 연구 릴리스에는 여전히 책임 있는 저자 표기, 동결된 소스/데이터와 삭제 묶음, 안정된 산출물 링크, 그 릴리스 꾸러미의 심사가 필요하다. 여기서는 지정되지도 공개되지도 않았다. 완료된 내부 심사는 기술 원고와 그 그림을 덮는다. 저널 동료심사도, 독립 장치 실행도 아니다. 교정은 연구 기록의 일부로 남는다.
개정 이력
2026년 9월 9일. 내부 심사를 거친 기술 초안의 웹사이트 열람판. 과학 주장과 기록값은 유지한다. 로컬 파일시스템 링크는 생략하고, 두 그림은 같은 기록값에서 어두운 열람면용으로 다시 그린다. 소스와 런타임 기록은 사적으로 남는다. 공개 산출물 릴리스도, 저널 동료심사도 아니다. 인터페이스 로케일은 이 열람판의 완역을 포함한다. 영어 본문이 원문이다.
Resumen
Una memoria limitada puede cambiar las acciones futuras de un agente, pero almacenar un fallo pasado no establece aprendizaje ni garantiza que la información se use. Examinamos un aparato ORIGIN existente en el que dos selectores deterministas exponen experiencias pasadas distintas a una regla de decisión fija. Un residente actúa en una cuenca redactada con recursos limitados durante 16 decisiones y debe terminar con al menos cinco unidades de reserva. Ambos selectores permiten dos registros y como máximo 8192 bytes UTF-8 canónicos. El episodio archivado responsive-priority alcanza la obligación; su contraparte de recencia no. Dos controles que ignoran la memoria seleccionada siguen secuencias idénticas de acción/estado y ambos fallan la obligación. La dependencia decisiva está redactada de forma explícita: la recencia retiene una pista de obstrucción observada, pero la rama de la decisión 5 de la regla responde específicamente a un stalled collect recordado. El informe documenta por tanto un mecanismo acotado y los límites de su verificación. No estima un efecto poblacional ni demuestra aprendizaje de LLM, motivación, supervivencia o equivalencia entre especies. Conservamos comparaciones de desarrollo nulas/adversas por separado y especificamos lo que necesitaría un estudio empírico posterior.
Términos
ORIGIN
Nombre propio del proyecto. No se traduce.
Sol-III
Nombre propio del mundo de cuenca redactado. No se traduce.
obligación diferida [delayed obligation]
Requisito puntuado solo tras la decisión 15: reserva final de al menos cinco. Superar cinco antes no es compleción.
recolección estancada [stalled collect]
Una acción collect sin aumento visible de reserva, incluida una disminución. Predicado del selector; no nombra una causa oculta. Identificador de fuente: stalledCollect.
selector
La política que elige qué registros archivados puede ver un residente. Aquí: priority frente a recency, cada uno con tope de dos registros y 8192 bytes UTF-8.
aparato [apparatus]
El montaje determinista ya registrado: mundo, selectores, proveedor, verificador y episodios guardados. Este informe lo lee; no lo vuelve a ejecutar.
residente [resident]
El agente que actúa en la cuenca. No es un organismo biológico; reserva cero no es muerte.
reserva [reserve]
El contador finito de recurso en el mundo redactado. La obligación diferida exige reserva final ≥ 5.
1. La pregunta y la evidencia
La pregunta de investigación es si priorizar las experiencias de acción fallida observadas por el propio residente frente a las recientes, con la misma capacidad de memoria, cambia la compleción de una obligación diferida —y bajo qué condiciones recordar esas experiencias deja el comportamiento igual. La respuesta presente se limita a un aparato determinista ya completado. Es útil porque la información seleccionada, la acción dependiente de la regla, el cambio de mundo con autoridad y el resultado pueden examinarse por separado.
El aparato se completó antes de esta toma de investigación. Este informe lee su fuente, los registros aceptados, siete episodios guardados y la tabla de decisiones derivada. Añade una auditoría de fuente/registro y figuras derivadas de esos datos guardados. No ejecuta el mundo, una prueba o verificador Go, un modelo en vivo ni un experimento de hardware. Cuatro memorandos de investigación externos aportaron preguntas y fuentes candidatas; sus respuestas no son evidencia empírica. La tabla compañera de afirmaciones/fuentes distingue hallazgos originales, observaciones locales, hipótesis y pistas no verificadas.
«Fallo» exige una definición operativa. El predicado del selector es una acción collect seguida de ningún aumento visible de reserva, incluida una disminución. No identifica una explicación causal oculta ni afirma que la acción fuera rechazada. «Diferida» se refiere a consecuencias de acciones anteriores que afectan la disponibilidad posterior de recurso y a una obligación evaluada solo tras la decisión 15. «A largo plazo» denota este horizonte finito; no significa un despliegue indefinido. Estas definiciones siguen el selector implementado y el contrato del aparato.
2. El aparato completado
La cuenca Sol-III current existente es un mundo redactado y adimensional. Su fuente define reserva inicial 4, effort 1, recurso almacenado 2 y una obstrucción. Reserva, effort y almacén tienen techos finitos. El residente elige entre inspect, collect, clear y rest. Despejar cambia el estado del obstáculo y con ello la captura posterior de lluvia. La percepción actual expone reserva, effort y una lectura de observación; no expone directamente cada variable del mundo. Las declaraciones de recurso y ciclo de vida no convierten la reserva cero en muerte: los residentes pueden seguir actuando en cero. El extremo medido es por tanto el aprovisionamiento en un plazo, no la supervivencia. Son descripciones a nivel de fuente de world.go, no afirmaciones de realismo biológico.
Cada registro de memoria vincula la percepción real previa a la acción de un residente, la acción elegida y la percepción posterior entregada a un linaje de episodio/ejecución. Solo son elegibles registros previos completos. El selector priority ordena primero los collect con cambio de reserva observado no positivo, luego rellena por recencia. El comparador ordena solo por recencia. Ambos devuelven los registros seleccionados en orden cronológico, omiten candidatos excesivos y limitan todo el arreglo seleccionado a dos registros y 8192 bytes. La selección no actualiza pesos de modelo. El anfitrión retiene el archivo mayor y la evidencia de omisión; el presupuesto de memoria frente al residente se aplica a la exposición seleccionada, no al almacenamiento total del computador.
Ambos brazos sensibles usan el mismo proveedor redactado sin estado. Su regla tiene un reloj explícito: en la decisión 5, correspondiente a once decisiones restantes incluida la actual, despeja solo si el effort visible es al menos tres y la memoria seleccionada contiene un stalled collect. Descansa en el intervalo medio y recolecta con effort positivo en las cuatro decisiones finales. Otras ramas anteriores responden a la memoria y a la percepción actual. Así el experimento no pide a un modelo que descubra una estrategia. La fuente del proveedor hace inspectable la dependencia.
Dos controles insensitive recolectan cuando el effort actual es positivo y si no descansan, sin usar la memoria seleccionada. Tres horarios literales comprueban una vía exitosa, esa vía con el despeje de la decisión 5 sustituido por rest, y el comportamiento de todo rest. La meta diferida se satisface solo cuando un episodio completo y válido de 16 decisiones tiene reserva final de al menos cinco. Cruzar cinco antes no basta.
El verificador registrado reconstruye la correspondencia entre manifiestos, diarios, intentos, solicitudes, memorias seleccionadas, acciones, observaciones y hechos finales antes de puntuar. No depende del proveedor; el residente mismo sigue usando un proveedor redactado. Una obligación incumplida válida es distinta de evidencia inválida o incompleta. Esta distinción evita que un fallo de meta se descarte en silencio como registro inválido y que una traza bien formada se tome por un resultado exitoso.
3. Resultados en las condiciones guardadas
Las siete condiciones registradas contienen 16 decisiones cada una. Sus 112 filas de decisión son mediciones anidadas, no 112 muestras independientes. Los valores siguientes se leyeron de resúmenes guardados de ejecución/verificación y se contrastaron con los estados finales extraídos correspondientes. Son resultados descriptivos de condición fija, sin intervalo ni valor p basados en muestreo. Resultados guardados, extracción de decisiones.
Condición
Reserva final
Obligación terminal
responsive-priority
5
Cumplida
responsive-recency
0
Incumplida
insensitive-priority
0
Incumplida
insensitive-recency
0
Incumplida
literal-success-priority
5
Cumplida
literal-no-clear-priority
0
Incumplida
literal-all-rest-priority
0
Incumplida
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Figura 1. Trayectorias ya redactadas. El par sensible difiere en la decisión de despeje y luego en la reserva. El par insensible tiene acciones y estados idénticos. El requisito rige solo en la decisión 15; una reserva de cinco en la decisión 0 no es compleción. Las líneas unen estados de decisión registrados y no denotan observaciones adicionales.
En la decisión 5, priority retiene las experiencias [1,4] y despeja; recency retiene [3,4] y descansa. Sus arreglos de memoria seleccionada contienen 2693 y 2692 bytes respectivamente, y los tamaños JSON de Petition capturados son 5039 y 5038 bytes. Unos techos de capacidad iguales no implican por tanto recuentos de bytes idénticos ni costes de tokens de LLM. Son bytes, no medidas de tokenizador. La fuente y la selección guardada establecen un cuello de dos registros en este límite; no establecen un cuello vinculante de 8192 bytes.
Los dos episodios sensibles terminan con reserva 5 y 0. Sus contrapartes literales dan las mismas trayectorias de reserva; sustituir el despeje por rest cambia el resultado diferido en el montaje redactado. Los dos episodios insensibles tienen secuencias idénticas de 16 pasos de acción/estado pese a memorias seleccionadas distintas. Es un control para la regla de decisión especificada, no un resultado general de que la memoria no pueda importar.
4. Lo que identifica la diferencia
La interpretación más respaldada es condicional: cambiar la política de selección cambia la información suministrada a esta regla sensible fija, su acción en la decisión 5 y el resultado posterior guardado. La dependencia está ingenierizada en la regla. El resultado no identifica una representación de memoria intrínsecamente superior ni un aprendizaje espontáneo.
Un detalle crítico es visible en el portador de recencia guardado. Sus bytes de memoria seleccionada en la decisión 5 incluyen la experiencia 3, una acción inspect cuya postobservación tiene reading: 1, la señal de obstrucción observada. El proveedor calcula una bandera a partir de tales postobservaciones, pero la rama de once decisiones restantes comprueba stalledCollect en su lugar. No usa esa bandera de obstrucción para disparar el despeje en este límite. En consecuencia, el brazo de recencia perdedor no puede describirse como carente de aviso potencialmente útil. Es una observación directa de fuente/registro; la proposición de que otra política explotaría la pista es una explicación alternativa plausible a probar, no un experimento nuevo realizado aquí. Portador de recencia guardado, regla sensible.
La comparación insensible también tiene una corrección retenida. Un control inicial esperaba distinta presencia/ausencia de stalled collects, pero ambos brazos retuvieron uno. El control corregido concernía experiencias retenidas distintas con trayectorias de mundo idénticas. Retener la expectativa fallida original evita que una historia de control equivocada se convierta en un resultado positivo. El registro aceptado del aparato documenta esa historia.
Ninguna condición de este conjunto aísla la necesidad del retraso o de la escasez al variarlas. El informe describe un mecanismo que opera en su presencia. No afirma que el mismo contraste de selectores dependa de forma única de ninguno de los dos rasgos, ni que persista bajo fallos obsoletos, prerrequisitos cambiados, políticas distintas o mundos no examinados.
5. La verificación es ella misma un objeto de evidencia
La ejecución del proveedor y la reejecución estricta comparten una regla redactada. Su acuerdo puede establecer consistencia y a la vez perder una desviación compartida del contrato documentado. Una variante privada errónea conservada acortó la ventana final de recolección de cuatro decisiones a tres; la verificación estricta de esa copia aceptó el episodio, mientras que la decisión 12 devolvió inspect en lugar del collect esperado de forma independiente. La regla de producto original era correcta. La reserva de cuatro de la política cambiada no es un resultado adverso del selector.
Una prueba aditiva suministró luego doce expectativas literales que cubren las decisiones 11, 12 y 15, effort positivo/cero y memoria de stalled collect vacía/retenida. Los registros históricos anotan que el control no modificado pasa y que tres variantes erróneas compilables fallan las aserciones previstas. En esta toma de investigación, los ocho hashes de registro de implementación y el hash actual del archivo de prueba coincidieron con sus valores registrados, y se inspeccionaron los mensajes de elección fallida pertinentes. Son comprobaciones nuevas de integridad/lectura de evidencia histórica, no pruebas recién ejecutadas. Auditoría de aceptación, prueba literal, órdenes y registros grabados.
Las comprobaciones de bytes actuales también emparejaron los 140 archivos de episodio guardados con los siete recibos existentes y las 95 entradas archivadas de fuente/módulo con el manifiesto responsive-priority. Esto sostiene la integridad del paquete inspeccionado. No atestigua qué binario se ejecutó originalmente, no establece que toda entrada del compilador esté archivada ni sustituye una reproducción independiente reciente. El informe conserva la limitación documentada de descubrimiento de fuente: el uso compilado exige el checkout de fuente en su ruta de construcción y una construcción sin -trimpath. Las afirmaciones de infraestructura completa, recuperación de fallos y corrección de todo el repositorio quedan fuera de este registro.
6. Evidencia de desarrollo anterior, aparte
El conjunto de datos más antiguo de preparación de artículo contiene ocho trayectorias redactadas, 128 momentos anidados y cuatro comparaciones de perfiles adaptive/baseline. Su métrica es la suma de la reserva llevada tras cada ProcessMoment en los momentos 0–15, medida en momentos-unidad de reserva. Las diferencias adaptive menos baseline son +4, 0, 0 y −1. No son la intervención priority/recency de arriba y no comparten su extremo terminal. Definiciones, cuatro comparaciones.
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Figura 2. Las cuatro comparaciones fijas de perfiles anteriores, con su métrica acumulada original. Se conservan los valores adversos y nulos. Esta figura es contexto de desarrollo aparte; no es muestreo adicional para la Figura 1.
En esa toma más antigua también se catalogan dos ensayos históricos de viabilidad de modelo local y dos filas de topología de aparato. Ninguno puede añadirse a las siete condiciones deterministas para ampliar una muestra de comportamiento. Las reejecuciones, reintentos, revaluaciones y las filas múltiples de una trayectoria conservan su linaje. Los perfiles más antiguos current, shifted, clustered y sparse ya se inspeccionaron y no pueden volverse una reserva ciega al renombrarlos.
7. Posición en la literatura
Los sistemas de memoria combinan intervenciones que deben distinguirse. Generative Agents combina factores de recuperación que incluyen recencia por acceso, importancia y relevancia; sus ablaciones de entrevista usan historias acumuladas por la arquitectura completa. Esa evaluación motiva separar sondas de decisión de historia común de intervenciones de trayectoria completa. No valida este resultado de cuenca. Park et al., 2023, §§4.1 and 6.1–6.2.
Reflexion cambia el contexto posterior mediante retroalimentación textual, no cambiando los pesos del modelo base. Su apéndice WebShop también informa un ajuste en el que la mejora intentada no se materializó. Tanto el mecanismo como esa limitación argumentan contra tratar la memoria o la reflexión como un beneficio incondicional. Conciernen tareas y estructuras de ensayo distintas de este aparato. Shinn et al., 2023, abstract and Appendix B.1.
Para un estudio empírico posterior, el tamaño muestral debe seguir un objetivo inferencial y supuestos justificados. La planificación basada en precisión, por ejemplo, exige una anchura de intervalo objetivo y una cuenta de la variabilidad; ningún artículo suministra un número suficiente universal de ejecuciones ORIGIN. Lakens, 2022, “Planning for Precision”.
La disponibilidad/funcionalidad de artefactos y los resultados obtenidos de forma independiente son logros separados en la terminología de artefactos de ACM. Este informe ofrece una auditoría local de integridad y una derivación reproducible de figuras; no reclama una insignia de revisión ni una replicación experimental independiente. ACM SIGIR artifact criteria.
LongMemEval evalúa estrategias de lectura con evidencia recuperada por oráculo y muestra que el diseño del lector afecta el rendimiento de QA incluso cuando se suministran las sesiones de evidencia. Esto refuerza la distinción entre recuperación y uso, dentro de una tarea de QA de historial de chat. No mide la acción en un mundo persistente. Wu et al., v2, §5.5.
XENON acopla la memoria de experiencia a la corrección de dependencias y a la corrección de acciones candidatas. Es por tanto una referencia para una intervención distinta de cambiar la exposición de episodios manteniendo fijo el selector de este aparato. Lee et al., v3, §§4.1–4.2.
Vending-Bench separa los límites de contexto reciente de las herramientas de memoria externa sin restricciones explícitas de almacenamiento. Su ablación original de capacidad de contexto de GPT-4o-mini informa peores resultados con límites mayores. Esto advierte contra tratar cada capa de memoria como un solo presupuesto o asumir un beneficio monótono; su dominio de negocio y sus modelos históricos no son resultados ORIGIN. Backlund and Petersson, v1, §§2.1 and 3.5.2.
El análisis de RL de pocas ejecuciones de Agarwal y colegas concierne la variabilidad entre ejecuciones estocásticas de entrenamiento/evaluación. Sus recomendaciones estadísticas exigen una estructura de muestreo apropiada y no suministran intervalos de confianza para estas siete condiciones redactadas. Agarwal et al., NeurIPS 2021.
Los hallazgos humanos/no humanos y de cómputo/cuántica siguen siendo entradas de portafolio separadas, no evidencia del resultado presente. La adjudicación de fuentes registra el alcance admitido y las correcciones a resúmenes de recolección demasiado estrechos o incompletos.
8. Una continuación falseable
Una siguiente pregunta empírica podría preguntar si el contraste de selectores cambia la probabilidad de meta de episodio completo para una distribución declarada de modelo/tarea. La dirección debe permanecer abierta. Un resultado negativo útil retendría un registro de fallo pertinente sin mejorar la acción elegida ni el resultado terminal; un resultado dañino también informaría. La inspección de fuente presente motiva además a distinguir la retención del contrato de uso de pistas de la regla de decisión.
Antes de cualquier recolección, defínanse las observaciones elegibles, el almacenamiento accesible y la exposición por decisión, las reglas de selector/empate/desborde, las indicaciones entregadas, el modelo y la versión pedida/informada, los límites de recurso, la distribución de mundo/estado inicial, la reserva protegida, el plazo, las expectativas del puntuador independiente, el linaje de fallo/reintento, la regla de parada y el análisis primario. Ajústense los techos de recurso permitidos informando el consumo real. No se fuerce a que las trayectorias de mundo/observación posteriores a la intervención permanezcan iguales; esas diferencias pueden llevar el efecto estudiado.
Úsense episodios completos como unidades, con bloques o pares de tarea declarados. Los mundos compartidos con residentes que interactúan requieren unidades de grupo/mundo. Establézcase el denominador de todos los episodios lanzados y el trato de resultados no disponibles antes de mirar los resultados. Una semilla común no garantiza aleatoriedad de modelo correspondiente tras divergir las trayectorias. Elíjase un efecto significativo o un objetivo de precisión y evalúese la sensibilidad del tamaño muestral bajo supuestos defendibles; estas cantidades quedan sin fijar aquí. Es un estudio propuesto, no un preregistro ni un resultado empírico completado.
9. Reproducción y disponibilidad
La fuente subyacente y los registros de ejecución siguen siendo privados. Esta edición de lectura conserva las afirmaciones científicas y los valores registrados del borrador revisado internamente. Las referencias locales de fuente y auditoría en el texto nombran registros de ese paquete privado; no son enlaces públicos de artefactos.
Las dos figuras SVG se redibujan a partir de los valores de extracción y comparación aceptados para este sitio. Los valores de las figuras permiten inspeccionar los puntos trazados. Reconstruir una figura no es reejecutar el mundo. Estos valores derivados no sustituyen la fuente subyacente, los registros de episodio ni el puntuador independiente.
Una publicación de investigación pública sigue exigiendo autoría responsable, un paquete congelado de fuente/datos y redacción, enlaces estables de artefactos y revisión de ese paquete de publicación. Aquí no se han asignado ni publicado. La revisión interna completada cubre el manuscrito técnico y sus figuras; no es revisión por pares de revista ni ejecución independiente del aparato. Las correcciones siguen formando parte del registro de investigación.
Historial de revisiones
9 de septiembre de 2026. Edición de lectura web del borrador técnico revisado internamente. Se conservan las afirmaciones científicas y los valores registrados. Se omiten enlaces al sistema de archivos local; las dos figuras se redibujan a partir de los mismos valores registrados para una superficie de lectura oscura. Fuente y registros de ejecución siguen privados. No es una publicación pública de artefactos ni revisión por pares de revista. Las interfaces incluyen una traducción completa de esta edición de lectura; el texto inglés sigue siendo el original.
Resumen
Una memoria limitada puede cambiar las acciones futuras de un agente, pero almacenar un fallo pasado no establece aprendizaje ni garantiza que la información se use. Examinamos un aparato ORIGIN existente en el que dos selectores deterministas exponen experiencias pasadas distintas a una regla de decisión fija. Un residente actúa en una cuenca redactada con recursos limitados durante 16 decisiones y debe terminar con al menos cinco unidades de reserva. Ambos selectores permiten dos registros y como máximo 8192 bytes UTF-8 canónicos. El episodio archivado responsive-priority alcanza la obligación; su contraparte de recencia no. Dos controles que ignoran la memoria seleccionada siguen secuencias idénticas de acción/estado y ambos fallan la obligación. La dependencia decisiva está redactada de forma explícita: la recencia retiene una pista de obstrucción observada, pero la rama de la decisión 5 de la regla responde específicamente a un stalled collect recordado. El reporte documenta por tanto un mecanismo acotado y los límites de su verificación. No estima un efecto poblacional ni demuestra aprendizaje de LLM, motivación, supervivencia o equivalencia entre especies. Conservamos comparaciones de desarrollo nulas/adversas por separado y especificamos lo que necesitaría un estudio empírico posterior.
Términos
ORIGIN
Nombre propio del proyecto. No se traduce.
Sol-III
Nombre propio del mundo de cuenca redactado. No se traduce.
obligación diferida [delayed obligation]
Requisito puntuado solo tras la decisión 15: reserva final de al menos cinco. Superar cinco antes no es compleción.
recolección estancada [stalled collect]
Una acción collect sin aumento visible de reserva, incluida una disminución. Predicado del selector; no nombra una causa oculta. Identificador de fuente: stalledCollect.
selector
La política que elige qué registros archivados puede ver un residente. Aquí: priority frente a recency, cada uno con tope de dos registros y 8192 bytes UTF-8.
aparato [apparatus]
El montaje determinista ya registrado: mundo, selectores, proveedor, verificador y episodios guardados. Este reporte lo lee; no lo vuelve a ejecutar.
residente [resident]
El agente que actúa en la cuenca. No es un organismo biológico; reserva cero no es muerte.
reserva [reserve]
El contador finito de recurso en el mundo redactado. La obligación diferida exige reserva final ≥ 5.
1. La pregunta y la evidencia
La pregunta de investigación es si priorizar las experiencias de acción fallida observadas por el propio residente frente a las recientes, con la misma capacidad de memoria, cambia la compleción de una obligación diferida —y bajo qué condiciones recordar esas experiencias deja el comportamiento igual. La respuesta presente se limita a un aparato determinista ya completado. Es útil porque la información seleccionada, la acción dependiente de la regla, el cambio de mundo con autoridad y el resultado pueden examinarse por separado.
El aparato se completó antes de esta toma de investigación. Este reporte lee su fuente, los registros aceptados, siete episodios guardados y la tabla de decisiones derivada. Añade una auditoría de fuente/registro y figuras derivadas de esos datos guardados. No ejecuta el mundo, una prueba o verificador Go, un modelo en vivo ni un experimento de hardware. Cuatro memorandos de investigación externos aportaron preguntas y fuentes candidatas; sus respuestas no son evidencia empírica. La tabla compañera de afirmaciones/fuentes distingue hallazgos originales, observaciones locales, hipótesis y pistas no verificadas.
«Fallo» exige una definición operativa. El predicado del selector es una acción collect seguida de ningún aumento visible de reserva, incluida una disminución. No identifica una explicación causal oculta ni afirma que la acción fuera rechazada. «Diferida» se refiere a consecuencias de acciones anteriores que afectan la disponibilidad posterior de recurso y a una obligación evaluada solo tras la decisión 15. «A largo plazo» denota este horizonte finito; no significa un despliegue indefinido. Estas definiciones siguen el selector implementado y el contrato del aparato.
2. El aparato completado
La cuenca Sol-III current existente es un mundo redactado y adimensional. Su fuente define reserva inicial 4, effort 1, recurso almacenado 2 y una obstrucción. Reserva, effort y almacén tienen techos finitos. El residente elige entre inspect, collect, clear y rest. Despejar cambia el estado del obstáculo y con ello la captura posterior de lluvia. La percepción actual expone reserva, effort y una lectura de observación; no expone directamente cada variable del mundo. Las declaraciones de recurso y ciclo de vida no convierten la reserva cero en muerte: los residentes pueden seguir actuando en cero. El extremo medido es por tanto el aprovisionamiento en un plazo, no la supervivencia. Son descripciones a nivel de fuente de world.go, no afirmaciones de realismo biológico.
Cada registro de memoria vincula la percepción real previa a la acción de un residente, la acción elegida y la percepción posterior entregada a un linaje de episodio/ejecución. Solo son elegibles registros previos completos. El selector priority ordena primero los collect con cambio de reserva observado no positivo, luego rellena por recencia. El comparador ordena solo por recencia. Ambos devuelven los registros seleccionados en orden cronológico, omiten candidatos excesivos y limitan todo el arreglo seleccionado a dos registros y 8192 bytes. La selección no actualiza pesos de modelo. El anfitrión retiene el archivo mayor y la evidencia de omisión; el presupuesto de memoria frente al residente se aplica a la exposición seleccionada, no al almacenamiento total de la computadora.
Ambos brazos sensibles usan el mismo proveedor redactado sin estado. Su regla tiene un reloj explícito: en la decisión 5, correspondiente a once decisiones restantes incluida la actual, despeja solo si el effort visible es al menos tres y la memoria seleccionada contiene un stalled collect. Descansa en el intervalo medio y recolecta con effort positivo en las cuatro decisiones finales. Otras ramas anteriores responden a la memoria y a la percepción actual. Así el experimento no pide a un modelo que descubra una estrategia. La fuente del proveedor hace inspectable la dependencia.
Dos controles insensitive recolectan cuando el effort actual es positivo y si no descansan, sin usar la memoria seleccionada. Tres horarios literales comprueban una vía exitosa, esa vía con el despeje de la decisión 5 sustituido por rest, y el comportamiento de todo rest. La meta diferida se satisface solo cuando un episodio completo y válido de 16 decisiones tiene reserva final de al menos cinco. Cruzar cinco antes no basta.
El verificador registrado reconstruye la correspondencia entre manifiestos, diarios, intentos, solicitudes, memorias seleccionadas, acciones, observaciones y hechos finales antes de puntuar. No depende del proveedor; el residente mismo sigue usando un proveedor redactado. Una obligación incumplida válida es distinta de evidencia inválida o incompleta. Esta distinción evita que un fallo de meta se descarte en silencio como registro inválido y que una traza bien formada se tome por un resultado exitoso.
3. Resultados en las condiciones guardadas
Las siete condiciones registradas contienen 16 decisiones cada una. Sus 112 filas de decisión son mediciones anidadas, no 112 muestras independientes. Los valores siguientes se leyeron de resúmenes guardados de ejecución/verificación y se contrastaron con los estados finales extraídos correspondientes. Son resultados descriptivos de condición fija, sin intervalo ni valor p basados en muestreo. Resultados guardados, extracción de decisiones.
Condición
Reserva final
Obligación terminal
responsive-priority
5
Cumplida
responsive-recency
0
Incumplida
insensitive-priority
0
Incumplida
insensitive-recency
0
Incumplida
literal-success-priority
5
Cumplida
literal-no-clear-priority
0
Incumplida
literal-all-rest-priority
0
Incumplida
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Figura 1. Trayectorias ya redactadas. El par sensible difiere en la decisión de despeje y luego en la reserva. El par insensible tiene acciones y estados idénticos. El requisito rige solo en la decisión 15; una reserva de cinco en la decisión 0 no es compleción. Las líneas unen estados de decisión registrados y no denotan observaciones adicionales.
En la decisión 5, priority retiene las experiencias [1,4] y despeja; recency retiene [3,4] y descansa. Sus arreglos de memoria seleccionada contienen 2693 y 2692 bytes respectivamente, y los tamaños JSON de Petition capturados son 5039 y 5038 bytes. Unos techos de capacidad iguales no implican por tanto recuentos de bytes idénticos ni costos de tokens de LLM. Son bytes, no medidas de tokenizador. La fuente y la selección guardada establecen un cuello de dos registros en este límite; no establecen un cuello vinculante de 8192 bytes.
Los dos episodios sensibles terminan con reserva 5 y 0. Sus contrapartes literales dan las mismas trayectorias de reserva; sustituir el despeje por rest cambia el resultado diferido en el montaje redactado. Los dos episodios insensibles tienen secuencias idénticas de 16 pasos de acción/estado pese a memorias seleccionadas distintas. Es un control para la regla de decisión especificada, no un resultado general de que la memoria no pueda importar.
4. Lo que identifica la diferencia
La interpretación más respaldada es condicional: cambiar la política de selección cambia la información suministrada a esta regla sensible fija, su acción en la decisión 5 y el resultado posterior guardado. La dependencia está ingenierizada en la regla. El resultado no identifica una representación de memoria intrínsecamente superior ni un aprendizaje espontáneo.
Un detalle crítico es visible en el portador de recencia guardado. Sus bytes de memoria seleccionada en la decisión 5 incluyen la experiencia 3, una acción inspect cuya postobservación tiene reading: 1, la señal de obstrucción observada. El proveedor calcula una bandera a partir de tales postobservaciones, pero la rama de once decisiones restantes comprueba stalledCollect en su lugar. No usa esa bandera de obstrucción para disparar el despeje en este límite. En consecuencia, el brazo de recencia perdedor no puede describirse como carente de aviso potencialmente útil. Es una observación directa de fuente/registro; la proposición de que otra política explotaría la pista es una explicación alternativa plausible a probar, no un experimento nuevo realizado aquí. Portador de recencia guardado, regla sensible.
La comparación insensible también tiene una corrección retenida. Un control inicial esperaba distinta presencia/ausencia de stalled collects, pero ambos brazos retuvieron uno. El control corregido concernía experiencias retenidas distintas con trayectorias de mundo idénticas. Retener la expectativa fallida original evita que una historia de control equivocada se convierta en un resultado positivo. El registro aceptado del aparato documenta esa historia.
Ninguna condición de este conjunto aísla la necesidad del retraso o de la escasez al variarlas. El reporte describe un mecanismo que opera en su presencia. No afirma que el mismo contraste de selectores dependa de forma única de ninguno de los dos rasgos, ni que persista bajo fallos obsoletos, prerrequisitos cambiados, políticas distintas o mundos no examinados.
5. La verificación es ella misma un objeto de evidencia
La ejecución del proveedor y la reejecución estricta comparten una regla redactada. Su acuerdo puede establecer consistencia y a la vez perder una desviación compartida del contrato documentado. Una variante privada errónea conservada acortó la ventana final de recolección de cuatro decisiones a tres; la verificación estricta de esa copia aceptó el episodio, mientras que la decisión 12 devolvió inspect en lugar del collect esperado de forma independiente. La regla de producto original era correcta. La reserva de cuatro de la política cambiada no es un resultado adverso del selector.
Una prueba aditiva suministró luego doce expectativas literales que cubren las decisiones 11, 12 y 15, effort positivo/cero y memoria de stalled collect vacía/retenida. Los registros históricos anotan que el control no modificado pasa y que tres variantes erróneas compilables fallan las aserciones previstas. En esta toma de investigación, los ocho hashes de registro de implementación y el hash actual del archivo de prueba coincidieron con sus valores registrados, y se inspeccionaron los mensajes de elección fallida pertinentes. Son comprobaciones nuevas de integridad/lectura de evidencia histórica, no pruebas recién ejecutadas. Auditoría de aceptación, prueba literal, órdenes y registros grabados.
Las comprobaciones de bytes actuales también emparejaron los 140 archivos de episodio guardados con los siete recibos existentes y las 95 entradas archivadas de fuente/módulo con el manifiesto responsive-priority. Esto sostiene la integridad del paquete inspeccionado. No atestigua qué binario se ejecutó originalmente, no establece que toda entrada del compilador esté archivada ni sustituye una reproducción independiente reciente. El reporte conserva la limitación documentada de descubrimiento de fuente: el uso compilado exige el checkout de fuente en su ruta de construcción y una construcción sin -trimpath. Las afirmaciones de infraestructura completa, recuperación de fallos y corrección de todo el repositorio quedan fuera de este registro.
6. Evidencia de desarrollo anterior, aparte
El conjunto de datos más antiguo de preparación de artículo contiene ocho trayectorias redactadas, 128 momentos anidados y cuatro comparaciones de perfiles adaptive/baseline. Su métrica es la suma de la reserva llevada tras cada ProcessMoment en los momentos 0–15, medida en momentos-unidad de reserva. Las diferencias adaptive menos baseline son +4, 0, 0 y −1. No son la intervención priority/recency de arriba y no comparten su extremo terminal. Definiciones, cuatro comparaciones.
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Figura 2. Las cuatro comparaciones fijas de perfiles anteriores, con su métrica acumulada original. Se conservan los valores adversos y nulos. Esta figura es contexto de desarrollo aparte; no es muestreo adicional para la Figura 1.
En esa toma más antigua también se catalogan dos ensayos históricos de viabilidad de modelo local y dos filas de topología de aparato. Ninguno puede añadirse a las siete condiciones deterministas para ampliar una muestra de comportamiento. Las reejecuciones, reintentos, revaluaciones y las filas múltiples de una trayectoria conservan su linaje. Los perfiles más antiguos current, shifted, clustered y sparse ya se inspeccionaron y no pueden volverse una reserva ciega al renombrarlos.
7. Posición en la literatura
Los sistemas de memoria combinan intervenciones que deben distinguirse. Generative Agents combina factores de recuperación que incluyen recencia por acceso, importancia y relevancia; sus ablaciones de entrevista usan historias acumuladas por la arquitectura completa. Esa evaluación motiva separar sondas de decisión de historia común de intervenciones de trayectoria completa. No valida este resultado de cuenca. Park et al., 2023, §§4.1 and 6.1–6.2.
Reflexion cambia el contexto posterior mediante retroalimentación textual, no cambiando los pesos del modelo base. Su apéndice WebShop también informa un ajuste en el que la mejora intentada no se materializó. Tanto el mecanismo como esa limitación argumentan contra tratar la memoria o la reflexión como un beneficio incondicional. Conciernen tareas y estructuras de ensayo distintas de este aparato. Shinn et al., 2023, abstract and Appendix B.1.
Para un estudio empírico posterior, el tamaño muestral debe seguir un objetivo inferencial y supuestos justificados. La planificación basada en precisión, por ejemplo, exige una anchura de intervalo objetivo y una cuenta de la variabilidad; ningún artículo suministra un número suficiente universal de ejecuciones ORIGIN. Lakens, 2022, “Planning for Precision”.
La disponibilidad/funcionalidad de artefactos y los resultados obtenidos de forma independiente son logros separados en la terminología de artefactos de ACM. Este reporte ofrece una auditoría local de integridad y una derivación reproducible de figuras; no reclama una insignia de revisión ni una replicación experimental independiente. ACM SIGIR artifact criteria.
LongMemEval evalúa estrategias de lectura con evidencia recuperada por oráculo y muestra que el diseño del lector afecta el rendimiento de QA incluso cuando se suministran las sesiones de evidencia. Esto refuerza la distinción entre recuperación y uso, dentro de una tarea de QA de historial de chat. No mide la acción en un mundo persistente. Wu et al., v2, §5.5.
XENON acopla la memoria de experiencia a la corrección de dependencias y a la corrección de acciones candidatas. Es por tanto una referencia para una intervención distinta de cambiar la exposición de episodios manteniendo fijo el selector de este aparato. Lee et al., v3, §§4.1–4.2.
Vending-Bench separa los límites de contexto reciente de las herramientas de memoria externa sin restricciones explícitas de almacenamiento. Su ablación original de capacidad de contexto de GPT-4o-mini informa peores resultados con límites mayores. Esto advierte contra tratar cada capa de memoria como un solo presupuesto o asumir un beneficio monótono; su dominio de negocio y sus modelos históricos no son resultados ORIGIN. Backlund and Petersson, v1, §§2.1 and 3.5.2.
El análisis de RL de pocas ejecuciones de Agarwal y colegas concierne la variabilidad entre ejecuciones estocásticas de entrenamiento/evaluación. Sus recomendaciones estadísticas exigen una estructura de muestreo apropiada y no suministran intervalos de confianza para estas siete condiciones redactadas. Agarwal et al., NeurIPS 2021.
Los hallazgos humanos/no humanos y de cómputo/cuántica siguen siendo entradas de portafolio separadas, no evidencia del resultado presente. La adjudicación de fuentes registra el alcance admitido y las correcciones a resúmenes de recolección demasiado estrechos o incompletos.
8. Una continuación falseable
Una siguiente pregunta empírica podría preguntar si el contraste de selectores cambia la probabilidad de meta de episodio completo para una distribución declarada de modelo/tarea. La dirección debe permanecer abierta. Un resultado negativo útil retendría un registro de fallo pertinente sin mejorar la acción elegida ni el resultado terminal; un resultado dañino también informaría. La inspección de fuente presente motiva además a distinguir la retención del contrato de uso de pistas de la regla de decisión.
Antes de cualquier recolección, defínanse las observaciones elegibles, el almacenamiento accesible y la exposición por decisión, las reglas de selector/empate/desborde, las indicaciones entregadas, el modelo y la versión pedida/informada, los límites de recurso, la distribución de mundo/estado inicial, la reserva protegida, el plazo, las expectativas del puntuador independiente, el linaje de fallo/reintento, la regla de parada y el análisis primario. Ajústense los techos de recurso permitidos informando el consumo real. No se fuerce a que las trayectorias de mundo/observación posteriores a la intervención permanezcan iguales; esas diferencias pueden llevar el efecto estudiado.
Úsense episodios completos como unidades, con bloques o pares de tarea declarados. Los mundos compartidos con residentes que interactúan requieren unidades de grupo/mundo. Establézcase el denominador de todos los episodios lanzados y el trato de resultados no disponibles antes de mirar los resultados. Una semilla común no garantiza aleatoriedad de modelo correspondiente tras divergir las trayectorias. Elíjase un efecto significativo o un objetivo de precisión y evalúese la sensibilidad del tamaño muestral bajo supuestos defendibles; estas cantidades quedan sin fijar aquí. Es un estudio propuesto, no un preregistro ni un resultado empírico completado.
9. Reproducción y disponibilidad
La fuente subyacente y los registros de ejecución siguen siendo privados. Esta edición de lectura conserva las afirmaciones científicas y los valores registrados del borrador revisado internamente. Las referencias locales de fuente y auditoría en el texto nombran registros de ese paquete privado; no son enlaces públicos de artefactos.
Las dos figuras SVG se redibujan a partir de los valores de extracción y comparación aceptados para este sitio. Los valores de las figuras permiten inspeccionar los puntos trazados. Reconstruir una figura no es reejecutar el mundo. Estos valores derivados no sustituyen la fuente subyacente, los registros de episodio ni el puntuador independiente.
Una publicación de investigación pública sigue exigiendo autoría responsable, un paquete congelado de fuente/datos y redacción, enlaces estables de artefactos y revisión de ese paquete de publicación. Aquí no se han asignado ni publicado. La revisión interna completada cubre el manuscrito técnico y sus figuras; no es revisión por pares de revista ni ejecución independiente del aparato. Las correcciones siguen formando parte del registro de investigación.
Historial de revisiones
9 de septiembre de 2026. Edición de lectura web del borrador técnico revisado internamente. Se conservan las afirmaciones científicas y los valores registrados. Se omiten enlaces al sistema de archivos local; las dos figuras se redibujan a partir de los mismos valores registrados para una superficie de lectura oscura. Fuente y registros de ejecución siguen privados. No es una publicación pública de artefactos ni revisión por pares de revista. Las interfaces incluyen una traducción completa de esta edición de lectura; el texto inglés sigue siendo el original.
Resumo
Memória limitada pode mudar as ações futuras de um agente, mas guardar uma falha passada não estabelece aprendizagem nem garante que a informação será usada. Examinamos um aparato ORIGIN existente em que dois seletores determinísticos expõem experiências passadas distintas a uma regra de decisão fixa. Um residente age numa bacia redigida com recursos limitados por 16 decisões e deve terminar com pelo menos cinco unidades de reserva. Ambos os seletores permitem dois registros e no máximo 8192 bytes UTF-8 canônicos. O episódio arquivado responsive-priority alcança a obrigação; a contraparte de recência não. Dois controles que ignoram a memória selecionada seguem sequências idênticas de ação/estado e ambos falham a obrigação. A dependência decisiva está redigida de forma explícita: a recência retém um indício de obstrução observado, mas o ramo da decisão 5 da regra responde especificamente a um stalled collect lembrado. O relatório documenta portanto um mecanismo limitado e os limites de sua verificação. Não estima um efeito populacional nem demonstra aprendizagem de LLM, motivação, sobrevivência ou equivalência entre espécies. Preservamos comparações de desenvolvimento nulas/adversas em separado e especificamos o que um estudo empírico posterior precisaria.
Termos
ORIGIN
Nome próprio do projeto. Não se traduz.
Sol-III
Nome próprio do mundo de bacia redigido. Não se traduz.
obrigação adiada [delayed obligation]
Requisito pontuado só após a decisão 15: reserva final de pelo menos cinco. Ultrapassar cinco antes não é conclusão.
coleta estagnada [stalled collect]
Uma ação collect sem aumento visível de reserva, inclusive uma diminuição. Predicado do seletor; não nomeia uma causa oculta. Identificador de fonte: stalledCollect.
seletor [selector]
A política que escolhe quais registros arquivados um residente pode ver. Aqui: priority versus recency, cada um limitado a dois registros e 8192 bytes UTF-8.
aparato [apparatus]
O aparato determinístico já registrado: mundo, seletores, provedor, verificador e episódios salvos. Este relatório o lê; não o reexecuta.
residente [resident]
O agente que age na bacia. Não é um organismo biológico; reserva zero não é morte.
reserva [reserve]
O contador finito de recurso no mundo redigido. A obrigação adiada exige reserva final ≥ 5.
1. A pergunta e a evidência
A pergunta de pesquisa é se priorizar as experiências de ação falha observadas pelo próprio residente sobre as recentes, na mesma capacidade de memória, muda a conclusão de uma obrigação adiada — e sob quais condições lembrar essas experiências deixa o comportamento inalterado. A resposta presente limita-se a um aparato determinístico já concluído. É útil porque a informação selecionada, a ação dependente da regra, a mudança de mundo com autoridade e o desfecho podem ser examinados em separado.
O aparato foi concluído antes desta tomada de pesquisa. Este relatório lê a fonte, os registros aceitos, sete episódios salvos e a tabela de decisões derivada. Acrescenta uma auditoria de fonte/registro e figuras derivadas desses dados salvos. Não executa o mundo, um teste ou verificador Go, um modelo ao vivo nem um experimento de hardware. Quatro memorandos de pesquisa externos forneceram perguntas e fontes candidatas; as respostas não são evidência empírica. A tabela companheira de afirmações/fontes distingue achados originais, observações locais, hipóteses e pistas não verificadas.
«Falha» exige uma definição operacional. O predicado do seletor é uma ação collect seguida de nenhum aumento visível de reserva, inclusive uma diminuição. Não identifica uma explicação causal oculta nem afirma que a ação foi rejeitada. «Adiada» refere-se a consequências de ações anteriores que afetam a disponibilidade posterior de recurso e a uma obrigação avaliada só após a decisão 15. «Longo prazo» denota este horizonte finito; não significa implantação indefinida. Essas definições seguem o seletor implementado e o contrato do aparato.
2. O aparato concluído
A bacia Sol-III current existente é um mundo redigido e adimensional. A fonte define reserva inicial 4, effort 1, recurso armazenado 2 e uma obstrução. Reserva, effort e estoque têm tetos finitos. O residente escolhe entre inspect, collect, clear e rest. Desobstruir muda o estado do obstáculo e com isso a captura posterior de chuva. A percepção atual expõe reserva, effort e uma leitura de observação; não expõe diretamente cada variável do mundo. As declarações de recurso e ciclo de vida não transformam reserva zero em morte: residentes podem continuar agindo em zero. O extremo medido é portanto o abastecimento num prazo, não a sobrevivência. São descrições ao nível da fonte de world.go, não afirmações de realismo biológico.
Cada registro de memória vincula a percepção real pré-ação de um residente, a ação escolhida e a percepção pós-ação entregue a uma linhagem de episódio/execução. Só registros prévios completos são elegíveis. O seletor priority classifica primeiro collects com variação de reserva observada não positiva, depois preenche por recência. O comparador classifica só por recência. Ambos devolvem os registros selecionados em ordem cronológica, saltam candidatos excessivos e limitam todo o arranjo selecionado a dois registros e 8192 bytes. A seleção não atualiza pesos de modelo. O anfitrião retém o arquivo maior e a evidência de omissão; o orçamento de memória voltado ao residente aplica-se à exposição selecionada, não ao armazenamento total do computador.
Ambos braços sensíveis usam o mesmo provedor redigido sem estado. A regra tem um relógio explícito: na decisão 5, correspondente a onze decisões restantes incluindo a atual, desobstrui só se o effort visível for pelo menos três e a memória selecionada contiver um stalled collect. Descansa no intervalo médio e coleta com effort positivo nas quatro decisões finais. Outros ramos anteriores respondem à memória e à percepção atual. Assim o experimento não pede a um modelo que descubra uma estratégia. A fonte do provedor torna a dependência inspecionável.
Dois controles insensitive coletam quando o effort atual é positivo e caso contrário descansam, sem usar a memória selecionada. Três horários literais verificam um caminho bem-sucedido, esse caminho com a desobstrução da decisão 5 substituída por rest, e o comportamento de tudo rest. A meta adiada só se satisfaz quando um episódio completo e válido de 16 decisões tem reserva final de pelo menos cinco. Cruzar cinco antes não basta.
O verificador registrado reconstrói a correspondência entre manifestos, diários, tentativas, pedidos, memórias selecionadas, ações, observações e fatos finais antes de pontuar. É independente do provedor; o residente ainda usa um provedor redigido. Uma obrigação não cumprida válida distingue-se de evidência inválida ou incompleta. Essa distinção impede que uma falha de meta seja silenciosamente descartada como registro inválido e que um traço bem formado seja tomado por um desfecho bem-sucedido.
3. Resultados nas condições salvas
As sete condições registradas contêm 16 decisões cada. Suas 112 linhas de decisão são medições aninhadas, não 112 amostras independentes. Os valores seguintes foram lidos de resumos salvos de execução/verificação e conferidos com os estados finais extraídos correspondentes. São resultados descritivos de condição fixa, sem intervalo nem valor-p baseados em amostragem. Resultados salvos, extração de decisões.
Condição
Reserva final
Obrigação terminal
responsive-priority
5
Cumprida
responsive-recency
0
Não cumprida
insensitive-priority
0
Não cumprida
insensitive-recency
0
Não cumprida
literal-success-priority
5
Cumprida
literal-no-clear-priority
0
Não cumprida
literal-all-rest-priority
0
Não cumprida
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Figura 1. Trajetórias já redigidas. O par sensível difere na decisão de desobstrução e depois na reserva. O par insensível tem ações e estados idênticos. O requisito vale só na decisão 15; reserva cinco na decisão 0 não é conclusão. As linhas ligam estados de decisão registrados e não denotam observações adicionais.
Na decisão 5, priority retém as experiências [1,4] e desobstrui; recency retém [3,4] e descansa. Seus arranjos de memória selecionada contêm 2693 e 2692 bytes respectivamente, e os tamanhos JSON de Petition capturados são 5039 e 5038 bytes. Tetos de capacidade iguais portanto não implicam contagens de bytes idênticas nem custos de tokens de LLM. São bytes, não medidas de tokenizador. A fonte e a seleção salva estabelecem um gargalo de dois registros neste limite; não estabelecem um gargalo vinculante de 8192 bytes.
Os dois episódios sensíveis terminam com reserva 5 e 0. Suas contrapartes literais produzem as mesmas trajetórias de reserva; substituir a desobstrução por rest muda o desfecho adiado no aparato redigido. Os dois episódios insensíveis têm sequências idênticas de 16 passos de ação/estado apesar de memórias selecionadas diferentes. É um controle para a regra de decisão especificada, não um resultado geral de que a memória não possa importar.
4. O que a diferença identifica
A interpretação mais sustentada é condicional: mudar a política de seleção muda a informação fornecida a esta regra sensível fixa, sua ação na decisão 5 e o desfecho posterior salvo. A dependência está engenheirada na regra. O resultado não identifica uma representação de memória intrinsecamente superior nem uma aprendizagem espontânea.
Um detalhe crítico é visível no portador de recência salvo. Seus bytes de memória selecionada na decisão 5 incluem a experiência 3, uma ação inspect cuja pós-observação tem reading: 1, o sinal de obstrução observado. O provedor calcula uma bandeira a partir de tais pós-observações, mas o ramo de onze decisões restantes verifica stalledCollect em vez disso. Não usa essa bandeira de obstrução para disparar a desobstrução neste limite. Consequentemente, o braço de recência perdedor não pode ser descrito como sem aviso potencialmente útil. É uma observação direta de fonte/registro; a proposição de que outra política exploraria o indício é uma explicação alternativa plausível a testar, não um experimento novo realizado aqui. Portador de recência salvo, regra sensível.
A comparação insensível também tem uma correção retida. Um controle inicial esperava presença/ausência distinta de stalled collects, mas ambos os braços retiveram um. O controle corrigido dizia respeito a experiências retidas distintas com trajetórias de mundo idênticas. Reter a expectativa falha original impede que uma história de controle enganosa se converta em um resultado positivo. O registro aceito do aparato documenta essa história.
Nenhuma condição deste conjunto isola a necessidade do atraso ou da escassez ao variá-las. O relatório descreve um mecanismo que opera na presença delas. Não afirma que o mesmo contraste de seletores dependa de forma única de nenhum dos dois traços, nem que persista sob falhas obsoletas, pré-requisitos mudados, políticas diferentes ou mundos não examinados.
5. A verificação é ela mesma um objeto de evidência
A execução do provedor e a reprodução estrita compartilham uma regra redigida. O acordo pode estabelecer consistência e ainda assim perder um desvio compartilhado do contrato documentado. Uma variante privada errada preservada encurtou a janela final de coleta de quatro decisões para três; a verificação estrita dessa cópia aceitou o episódio, enquanto a decisão 12 devolveu inspect em vez do collect esperado de forma independente. A regra de produto original estava correta. A reserva quatro da política mudada não é um resultado adverso do seletor.
Um teste aditivo então forneceu doze expectativas literais abrangendo as decisões 11, 12 e 15, effort positivo/zero e memória de stalled collect vazia/retida. Os registros históricos anotam o controle não modificado passando e três variantes erradas compiláveis falhando as asserções previstas. Nesta tomada de pesquisa, todos os oito hashes de log de implementação e o hash atual do arquivo de teste coincidiram com os valores registrados, e as mensagens de escolha falha pertinentes foram inspecionadas. São checagens novas de integridade/leitura de evidência histórica, não testes recém-executados. Auditoria de aceitação, teste literal, comandos e registros gravados.
As checagens de bytes atuais também emparelharam os 140 arquivos de episódio salvos com os sete recibos existentes e as 95 entradas arquivadas de fonte/módulo com o manifesto responsive-priority. Isso sustenta a integridade do pacote inspecionado. Não atesta qual binário foi executado originalmente, não estabelece que toda entrada do compilador esteja arquivada nem substitui uma reprodução independente recente. O relatório preserva a limitação documentada de descoberta de fonte: o uso compilado exige o checkout de fonte em seu caminho de construção e uma construção sem -trimpath. Afirmações de infraestrutura completa, recuperação de falha e correção de todo o repositório permanecem fora deste registro.
6. Evidência de desenvolvimento anterior, em separado
O conjunto de dados mais antigo de prontidão de artigo contém oito trajetórias redigidas, 128 momentos aninhados e quatro comparações de perfis adaptive/baseline. A métrica é a soma da reserva carregada após cada ProcessMoment nos momentos 0–15, medida em momentos-unidade de reserva. As diferenças adaptive menos baseline são +4, 0, 0 e −1. Não são a intervenção priority/recency acima e não compartilham o extremo terminal. Definições, quatro comparações.
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Figura 2. As quatro comparações fixas de perfis anteriores, com a métrica acumulada original. Os valores adversos e nulos são retidos. Esta figura é contexto de desenvolvimento separado; não é amostragem adicional para a Figura 1.
Nessa tomada mais antiga também se catalogam dois ensaios históricos de viabilidade de modelo local e duas linhas de topologia de aparato. Nenhum pode ser acrescentado às sete condições determinísticas para ampliar uma amostra comportamental. Reproduções, novas tentativas, reavaliações e várias linhas de uma trajetória retêm a linhagem. Os perfis mais antigos current, shifted, clustered e sparse já foram inspecionados e não podem tornar-se um holdout cego ao renomeá-los.
7. Posição na literatura
Sistemas de memória combinam intervenções que devem ser distinguidas. Generative Agents combina fatores de recuperação incluindo recência por acesso, importância e relevância; suas ablações de entrevista usam histórias acumuladas pela arquitetura completa. Essa avaliação motiva separar sondas de decisão de história comum de intervenções de trajetória completa. Não valida este resultado de bacia. Park et al., 2023, §§4.1 and 6.1–6.2.
Reflexion muda o contexto posterior por retroalimentação textual, sem mudar os pesos do modelo-base. Seu apêndice WebShop também relata um ajuste em que a melhoria tentada não se materializou. Tanto o mecanismo quanto essa limitação argumentam contra tratar memória ou reflexão como benefício incondicional. Dizem respeito a tarefas e estruturas de ensaio distintas deste aparato. Shinn et al., 2023, abstract and Appendix B.1.
Para um estudo empírico posterior, o tamanho amostral deve seguir um objetivo inferencial e premissas justificadas. O planejamento baseado em precisão, por exemplo, exige uma largura de intervalo-alvo e uma conta da variabilidade; nenhum artigo fornece um número suficiente universal de execuções ORIGIN. Lakens, 2022, “Planning for Precision”.
Disponibilidade/funcionalidade de artefatos e resultados obtidos independentemente são conquistas separadas na terminologia de artefatos da ACM. Este relatório oferece uma auditoria local de integridade e uma derivação reproduzível de figuras; não reivindica um selo de revisão nem uma replicação experimental independente. ACM SIGIR artifact criteria.
LongMemEval avalia estratégias de leitura com evidência recuperada por oráculo e mostra que o desenho do leitor afeta o desempenho de QA mesmo quando as sessões de evidência são fornecidas. Isso fortalece a distinção entre recuperação e uso, numa tarefa de QA de histórico de chat. Não mede ação em mundo persistente. Wu et al., v2, §5.5.
XENON acopla a memória de experiência à correção de dependências e à correção de ações candidatas. É portanto uma referência para uma intervenção distinta de mudar a exposição de episódios mantendo fixo o seletor deste aparato. Lee et al., v3, §§4.1–4.2.
Vending-Bench separa limites de contexto recente de ferramentas de memória externa sem restrições explícitas de armazenamento. Sua ablação original de capacidade de contexto do GPT-4o-mini relata piores desfechos com limites maiores. Isso adverte contra tratar cada camada de memória como um só orçamento ou assumir benefício monotônico; seu domínio de negócios e modelos históricos não são resultados ORIGIN. Backlund and Petersson, v1, §§2.1 and 3.5.2.
A análise de RL de poucas execuções de Agarwal e colegas concerne a variabilidade entre execuções estocásticas de treino/avaliação. Suas recomendações estatísticas exigem uma estrutura amostral apropriada e não fornecem intervalos de confiança para estas sete condições redigidas. Agarwal et al., NeurIPS 2021.
Achados humanos/não humanos e de computação/quântica permanecem entradas de portfólio separadas, não evidência do resultado presente. A adjudicação de fontes registra o alcance admitido e correções a resumos de coleta estreitos demais ou incompletos.
8. Uma continuação falseável
Uma próxima pergunta empírica poderia perguntar se o contraste de seletores muda a probabilidade de meta de episódio completo para uma distribuição declarada de modelo/tarefa. A direção deve permanecer aberta. Um resultado negativo útil reteria um registro de falha pertinente sem melhorar a ação escolhida nem o desfecho terminal; um resultado prejudicial também informaria. A inspeção de fonte presente motiva ainda a distinguir a retenção do contrato de uso de indícios da regra de decisão.
Antes de qualquer coleta, definam-se as observações elegíveis, o armazenamento acessível e a exposição por decisão, as regras de seletor/empate/estouro, os prompts entregues, o modelo e a versão pedida/relatada, os limites de recurso, a distribuição de mundo/estado inicial, o holdout protegido, o prazo, as expectativas do pontuador independente, a linhagem de falha/nova tentativa, a regra de parada e a análise primária. Igualem-se os tetos de recurso permitidos relatando o consumo real. Não se force que as trajetórias de mundo/observação pós-intervenção permaneçam iguais; essas diferenças podem carregar o efeito estudado.
Usem-se episódios completos como unidades, com blocos ou pares de tarefa declarados. Mundos compartilhados com residentes que interagem exigem unidades de grupo/mundo. Declare-se o denominador de todos os episódios lançados e o tratamento de desfechos indisponíveis antes de olhar os resultados. Uma semente comum não garante aleatoriedade de modelo correspondente depois que as trajetórias divergem. Escolha-se um efeito significativo ou um alvo de precisão e avalie-se a sensibilidade do tamanho amostral sob premissas defensáveis; essas quantidades permanecem indefinidas aqui. É um estudo proposto, não um pré-registro nem um resultado empírico concluído.
9. Reprodução e disponibilidade
A fonte subjacente e os registros de execução permanecem privados. Esta edição de leitura preserva as afirmações científicas e os valores registrados do rascunho revisado internamente. As referências locais de fonte e auditoria no texto nomeiam registros daquele pacote privado; não são ligações públicas de artefatos.
As duas figuras SVG são redesenhadas a partir dos valores de extração e comparação aceitos para este sítio. Os valores das figuras permitem inspecionar os pontos traçados. Reconstruir uma figura é diferente de reproduzir o mundo. Esses valores derivados não substituem a fonte subjacente, os registros de episódio nem o pontuador independente.
Uma publicação de pesquisa pública ainda exige autoria responsável, um pacote congelado de fonte/dados e redação, ligações estáveis de artefatos e revisão desse pacote de publicação. Aqui não foram atribuídos nem publicados. A revisão interna concluída cobre o manuscrito técnico e suas figuras; não é revisão por pares de periódico nem execução independente do aparato. Correções permanecem parte do registro de pesquisa.
Histórico de revisões
9 de setembro de 2026. Edição de leitura na web do rascunho técnico revisado internamente. As afirmações científicas e os valores registrados são retidos. Ligações ao sistema de arquivos local são omitidas; as duas figuras são redesenhadas a partir dos mesmos valores registrados para uma superfície de leitura escura. Fonte e registros de execução permanecem privados. Não é uma publicação pública de artefatos nem revisão por pares de periódico. As interfaces incluem uma tradução completa desta edição de leitura; o texto inglês permanece o original.
Résumé
Une mémoire limitée peut changer les actions futures d’un agent, mais stocker un échec passé n’établit pas un apprentissage et ne garantit pas que l’information sera utilisée. Nous examinons un appareil ORIGIN existant dans lequel deux sélecteurs déterministes exposent des expériences passées différentes à une règle de décision fixe. Un résident agit dans un bassin rédigé à ressources contraintes pendant 16 décisions et doit terminer avec au moins cinq unités de réserve. Les deux sélecteurs autorisent deux enregistrements et au plus 8192 octets UTF-8 canoniques. L’épisode archivé responsive-priority atteint l’obligation ; son pendant de récence ne l’atteint pas. Deux témoins qui ignorent la mémoire sélectionnée suivent des séquences action/état identiques et manquent tous deux l’obligation. La dépendance décisive est rédigée explicitement : la récence retient un indice d’obstruction observé, mais la branche de la décision 5 de la règle répond spécifiquement à un stalled collect mémorisé. Le rapport documente donc un mécanisme borné et les limites de sa vérification. Il n’estime pas un effet de population et ne démontre pas un apprentissage de LLM, une motivation, une survie ou une équivalence interspécifique. Nous conservons des comparaisons de développement nulles/adverses distinctes et précisons ce dont une étude empirique ultérieure aurait besoin.
Termes
ORIGIN
Nom propre du projet. Non traduit.
Sol-III
Nom propre du monde de bassin rédigé. Non traduit.
obligation différée [delayed obligation]
Exigence notée seulement après la décision 15 : réserve finale d’au moins cinq. Dépasser cinq plus tôt n’est pas un achèvement.
collecte bloquée [stalled collect]
Une action collect sans hausse visible de la réserve, y compris une baisse. Prédicat du sélecteur ; il ne nomme pas une cause cachée. Identifiant source : stalledCollect.
sélecteur [selector]
La politique qui choisit quels enregistrements archivés un résident peut voir. Ici : priority contre recency, chacun plafonné à deux enregistrements et 8192 octets UTF-8.
appareil [apparatus]
Le dispositif déterministe déjà consigné : monde, sélecteurs, fournisseur, vérificateur et épisodes enregistrés. Ce rapport le lit ; il ne le relance pas.
résident [resident]
L’agent qui agit dans le bassin. Ce n’est pas un organisme biologique ; une réserve nulle n’est pas la mort.
réserve [reserve]
Le compteur de ressource fini dans le monde rédigé. L’obligation différée exige une réserve finale ≥ 5.
1. La question et les preuves
La question de recherche est de savoir si, à capacité de mémoire égale, prioriser les expériences d’action échouée observées par le résident lui-même par rapport aux expériences récentes change l’achèvement d’une obligation différée — et dans quelles conditions se souvenir de ces expériences laisse le comportement inchangé. La réponse actuelle se limite à un appareil déterministe déjà achevé. Elle est utile parce que l’information sélectionnée, l’action dépendante de la règle, le changement de monde autoritatif et le résultat peuvent être examinés séparément.
L’appareil a été achevé avant cette prise de recherche. Ce rapport lit sa source, les enregistrements acceptés, sept épisodes sauvegardés et la table de décisions dérivée. Il ajoute un audit source/enregistrement et des figures dérivées de ces données sauvegardées. Il n’exécute ni le monde, ni un test ou vérificateur Go, ni un modèle vivant, ni une expérience matérielle. Quatre notes de recherche externes ont fourni des questions et des sources candidates ; leurs réponses ne sont pas des preuves empiriques. La table compagnon des assertions/sources distingue constatations originales, observations locales, hypothèses et pistes non vérifiées.
« Échec » exige une définition opérationnelle. Le prédicat du sélecteur est une action collect suivie d’aucune hausse visible de la réserve, y compris une baisse. Il n’identifie pas une explication causale cachée et n’affirme pas que l’action a été rejetée. « Différée » désigne les conséquences d’actions antérieures qui affectent la disponibilité ultérieure de la ressource, et une obligation évaluée seulement après la décision 15. « Long terme » désigne cet horizon fini ; ce n’est pas un déploiement indéfini. Ces définitions suivent le sélecteur implémenté et le contrat de l’appareil.
2. L’appareil achevé
Le bassin Sol-III current existant est un monde rédigé, sans dimension. Sa source définit une réserve initiale 4, effort 1, une ressource stockée 2 et une obstruction. Réserve, effort et stock ont des plafonds finis. Le résident choisit parmi inspect, collect, clear et rest. Dégager change l’état de l’obstacle et donc la capture ultérieure de pluie. La perception actuelle expose réserve, effort et une lecture d’observation ; elle n’expose pas directement chaque variable du monde. Les déclarations de ressource et de cycle de vie ne transforment pas une réserve nulle en mort : les résidents peuvent continuer d’agir à zéro. L’extrémité mesurée est donc l’approvisionnement à une échéance, non la survie. Ce sont des descriptions au niveau source de world.go, non des prétentions de réalisme biologique.
Chaque enregistrement de mémoire lie la perception réelle pré-action d’un résident, l’action choisie et la perception post-action livrée à une lignée d’épisode/exécution. Seuls les enregistrements antérieurs complets sont éligibles. Le sélecteur priority classe d’abord les collect dont le changement de réserve observé n’est pas positif, puis complète par récence. Le comparateur classe par récence seule. Tous deux renvoient les enregistrements sélectionnés chronologiquement, sautent les candidats trop grands et plafonnent tout le tableau sélectionné à deux enregistrements et 8192 octets. La sélection ne met pas à jour les poids d’un modèle. L’hôte conserve la plus grande archive et les preuves d’omission ; le budget de mémoire côté résident s’applique à l’exposition sélectionnée, non au stockage total de l’ordinateur.
Les deux bras sensibles utilisent le même fournisseur rédigé sans état. Sa règle a une horloge explicite : à la décision 5, correspondant à onze décisions restantes y compris la courante, il dégage seulement si l’effort visible est d’au moins trois et si la mémoire sélectionnée contient un stalled collect. Il se repose dans l’intervalle médian et collecte avec un effort positif pendant les quatre dernières décisions. D’autres branches plus tôt répondent à la mémoire et à la perception actuelle. L’expérience ne demande donc pas à un modèle de découvrir une stratégie. La source du fournisseur rend la dépendance inspectable.
Deux témoins insensitive collectent lorsque l’effort courant est positif et sinon se reposent, sans utiliser la mémoire sélectionnée. Trois calendriers littéraux vérifient une voie réussie, cette voie avec le dégagement de la décision 5 remplacé par rest, et un comportement tout rest. Le but différé n’est satisfait que lorsqu’un épisode complet et valide de 16 décisions a une réserve finale d’au moins cinq. Franchir cinq plus tôt ne suffit pas.
Le vérificateur enregistré reconstitue la correspondance entre manifeste, journaux, tentatives, requêtes, mémoires sélectionnées, actions, observations et faits finaux avant de noter. Il est indépendant du fournisseur ; le résident lui-même utilise encore un fournisseur rédigé. Une obligation manquée valide est distincte d’une preuve invalide ou incomplète. Cette distinction empêche qu’un échec de but soit silencieusement écarté comme enregistrement invalide et qu’une trace bien formée soit prise pour un résultat réussi.
3. Résultats dans les conditions sauvegardées
Les sept conditions enregistrées contiennent chacune 16 décisions. Leurs 112 lignes de décision sont des mesures emboîtées, non 112 échantillons indépendants. Les valeurs suivantes ont été lues dans des résumés d’exécution/vérification sauvegardés et confrontées aux états finaux extraits correspondants. Ce sont des résultats descriptifs à condition fixe, sans intervalle ni valeur p fondés sur un échantillonnage. Résultats sauvegardés, extraction des décisions.
Condition
Réserve finale
Obligation terminale
responsive-priority
5
Atteinte
responsive-recency
0
Manquée
insensitive-priority
0
Manquée
insensitive-recency
0
Manquée
literal-success-priority
5
Atteinte
literal-no-clear-priority
0
Manquée
literal-all-rest-priority
0
Manquée
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Figure 1. Trajectoires déjà rédigées. La paire sensible diffère à la décision de dégagement, puis dans la réserve. La paire insensible a des actions et des états identiques. L’exigence ne s’applique qu’à la décision 15 ; une réserve de cinq à la décision 0 n’est pas un achèvement. Les lignes relient des états de décision enregistrés et ne dénotent pas d’observations supplémentaires.
À la décision 5, priority retient les expériences [1,4] et dégage ; recency retient [3,4] et se repose. Leurs tableaux de mémoire sélectionnée contiennent respectivement 2693 et 2692 octets, et les tailles JSON de Petition capturées sont 5039 et 5038 octets. Des plafonds de capacité égaux n’impliquent donc pas des comptes d’octets identiques ni des coûts de jetons de LLM. Ce sont des octets, non des mesures de tokéniseur. La source et la sélection sauvegardée établissent un goulot de deux enregistrements à cette limite ; elles n’établissent pas un goulot contraignant de 8192 octets.
Les deux épisodes sensibles se terminent avec une réserve 5 et 0. Leurs pendants littéraux donnent les mêmes trajectoires de réserve ; remplacer le dégagement par rest change le résultat différé dans le dispositif rédigé. Les deux épisodes insensibles ont des séquences action/état identiques sur 16 pas malgré des mémoires sélectionnées différentes. C’est un témoin pour la règle de décision spécifiée, non un résultat général selon lequel la mémoire ne pourrait pas compter.
4. Ce que la différence identifie
L’interprétation la plus étayée est conditionnelle : changer la politique de sélection change l’information fournie à cette règle sensible fixe, son action à la décision 5 et le résultat aval sauvegardé. La dépendance est conçue dans la règle. Le résultat n’identifie pas une représentation de mémoire intrinsèquement supérieure ni un apprentissage spontané.
Un détail critique est visible dans le porteur de récence sauvegardé. Ses octets de mémoire sélectionnée à la décision 5 incluent l’expérience 3, une action inspect dont la post-observation a reading: 1, le signal d’obstruction observé. Le fournisseur calcule un drapeau à partir de telles post-observations, mais la branche des onze décisions restantes vérifie stalledCollect à la place. Il n’utilise pas ce drapeau d’obstruction pour déclencher le dégagement à cette limite. Par conséquent, le bras de récence perdant ne peut pas être décrit comme dépourvu d’avertissement potentiellement utile. C’est une observation directe source/enregistrement ; la proposition qu’une autre politique exploiterait l’indice est une explication alternative plausible à tester, non une expérience nouvelle menée ici. Porteur de récence sauvegardé, règle sensible.
La comparaison insensible a aussi une correction retenue. Un témoin initial attendait une présence/absence différente de stalled collects, mais les deux bras en ont retenu un. Le témoin corrigé concernait des expériences retenues différentes avec des trajectoires de monde identiques. Conserver l’attente initiale échouée empêche qu’une histoire de témoin erronée soit convertie en un résultat positif. L’enregistrement accepté de l’appareil documente cette histoire.
Aucune condition de cet ensemble n’isole la nécessité du délai ou de la rareté en les faisant varier. Le rapport décrit un mécanisme opérant en leur présence. Il n’affirme pas que le même contraste de sélecteurs dépende uniquement de l’une ou l’autre caractéristique, ni qu’il persiste sous des échecs obsolètes, des prérequis changés, des politiques différentes ou des mondes non examinés.
5. La vérification est elle-même un objet de preuve
L’exécution du fournisseur et la relecture stricte partagent une règle rédigée. Leur accord peut établir une cohérence tout en manquant un écart partagé par rapport au contrat documenté. Une variante privée fautive conservée a raccourci la fenêtre finale de collecte de quatre décisions à trois ; la vérification stricte de cette copie a accepté l’épisode, tandis que la décision 12 a renvoyé inspect plutôt que le collect attendu indépendamment. La règle produit d’origine était correcte. La réserve de quatre de la politique changée n’est pas un résultat adverse du sélecteur.
Un test additif a ensuite fourni douze attentes littérales couvrant les décisions 11, 12 et 15, l’effort positif/nul et une mémoire stalled collect vide/retenue. Les journaux historiques enregistrent le témoin non modifié qui passe et trois variantes fautives compilables qui échouent aux assertions prévues. Dans cette prise de recherche, les huit hachages de journal d’implémentation et le hachage actuel du fichier de test ont concordé avec leurs valeurs enregistrées, et les messages de choix échoué pertinents ont été inspectés. Ce sont des contrôles neufs d’intégrité/lecture de preuves historiques, non des tests fraîchement exécutés. Audit d’acceptation, test littéral, commandes et journaux enregistrés.
Les contrôles d’octets actuels ont aussi apparié les 140 fichiers d’épisode sauvegardés aux sept reçus existants et les 95 entrées archivées source/module au manifeste responsive-priority. Cela étaye l’intégrité du paquet inspecté. Cela n’atteste pas quel binaire s’est exécuté à l’origine, n’établit pas que toute entrée de compilateur est archivée et ne remplace pas une reproduction indépendante fraîche. Le rapport conserve la limitation documentée de découverte de source : l’usage compilé exige le checkout source à son chemin de construction et une construction sans -trimpath. Les prétentions d’infrastructure complète, de reprise sur incident et de correction à l’échelle du dépôt restent hors de cet enregistrement.
6. Preuves de développement antérieur, distinctes
Le jeu de données plus ancien de préparation d’article contient huit trajectoires rédigées, 128 moments emboîtés et quatre comparaisons de profils adaptive/baseline. Sa métrique est la somme de la réserve portée après chaque ProcessMoment sur les moments 0–15, mesurée en moments-unités de réserve. Les différences adaptive moins baseline sont +4, 0, 0 et −1. Ce n’est pas l’intervention priority/recency ci-dessus, et elles n’en partagent pas l’extrémité terminale. Définitions, quatre comparaisons.
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Figure 2. Les quatre comparaisons de profils fixes antérieures, avec leur métrique cumulative d’origine. Les valeurs adverses et nulles sont conservées. Cette figure est un contexte de développement distinct ; ce n’est pas un échantillonnage supplémentaire pour la Figure 1.
Deux essais historiques de faisabilité de modèle local et deux lignes de topologie d’appareil sont aussi catalogués dans cette prise plus ancienne. Aucun ne peut s’ajouter aux sept conditions déterministes pour agrandir un échantillon comportemental. Relectures, nouvelles tentatives, re-notations et lignes multiples d’une trajectoire conservent leur lignée. Les profils plus anciens current, shifted, clustered et sparse ont déjà été inspectés et ne peuvent devenir une réserve aveugle par simple renommage.
7. Position dans la littérature
Les systèmes de mémoire combinent des interventions qu’il faut distinguer. Generative Agents combine des facteurs de récupération dont la récence d’accès, l’importance et la pertinence ; ses ablations d’entretien utilisent des historiques accumulés par l’architecture entière. Cette évaluation motive à séparer des sondes de décision à histoire commune des interventions de trajectoire complète. Elle ne valide pas ce résultat de bassin. Park et al., 2023, §§4.1 and 6.1–6.2.
Reflexion change le contexte ultérieur par rétroaction textuelle plutôt qu’en changeant les poids du modèle de base. Son annexe WebShop rapporte aussi un cadre où l’amélioration tentée ne s’est pas matérialisée. Le mécanisme et cette limite plaident contre le traitement de la mémoire ou de la réflexion comme un bénéfice inconditionnel. Ils concernent des tâches et des structures d’essai différentes de cet appareil. Shinn et al., 2023, abstract and Appendix B.1.
Pour une étude empirique ultérieure, la taille d’échantillon doit suivre un objectif inférentiel et des hypothèses justifiées. Une planification fondée sur la précision, par exemple, exige une largeur d’intervalle cible et un compte de la variabilité ; aucun article ne fournit un nombre suffisant universel de runs ORIGIN. Lakens, 2022, “Planning for Precision”.
La disponibilité/fonctionnalité d’artefacts et les résultats obtenus indépendamment sont des accomplissements distincts dans la terminologie d’artefacts de l’ACM. Ce rapport offre un audit d’intégrité local et une dérivation reproductible de figures ; il ne revendique ni un badge d’examen ni une réplication expérimentale indépendante. ACM SIGIR artifact criteria.
LongMemEval évalue des stratégies de lecture avec des preuves récupérées par oracle et montre que la conception du lecteur affecte la performance QA même lorsque les séances de preuve sont fournies. Cela renforce la distinction entre récupération et usage, dans une tâche QA d’historique de chat. Cela ne mesure pas l’action en monde persistant. Wu et al., v2, §5.5.
XENON couple la mémoire d’expérience à la correction de dépendances et à la correction d’actions candidates. C’est donc une référence pour une intervention différente du changement d’exposition d’épisode en gardant fixe le sélecteur de cet appareil. Lee et al., v3, §§4.1–4.2.
Vending-Bench sépare les limites de contexte récent des outils de mémoire externe sans contraintes de stockage explicites. Son ablation originale de capacité de contexte GPT-4o-mini rapporte de moins bons résultats avec des limites plus grandes. Cela met en garde contre le traitement de chaque couche de mémoire comme un seul budget ou l’hypothèse d’un bénéfice monotone ; son domaine d’affaires et ses modèles historiques ne sont pas des résultats ORIGIN. Backlund and Petersson, v1, §§2.1 and 3.5.2.
L’analyse RL à peu de runs d’Agarwal et collègues concerne la variabilité entre exécutions stochastiques d’entraînement/évaluation. Ses recommandations statistiques exigent une structure d’échantillonnage appropriée et ne fournissent pas d’intervalles de confiance pour ces sept conditions rédigées. Agarwal et al., NeurIPS 2021.
Les constatations humaines/non humaines et calcul/quantique restent des entrées de portefeuille distinctes, non des preuves du résultat présent. L’adjudication des sources consigne la portée admise et les corrections d’abrégés de collecte trop étroits ou incomplets.
8. Une suite falsifiable
Une question empirique suivante pourrait demander si le contraste de sélecteurs change la probabilité de but d’épisode complet pour une distribution déclarée de modèle/tâche. La direction doit rester ouverte. Un résultat négatif utile retiendrait un enregistrement d’échec pertinent sans améliorer l’action choisie ni le résultat terminal ; un résultat nuisible serait aussi informatif. L’inspection de source actuelle motive en outre à distinguer la rétention du contrat d’usage d’indices de la règle de décision.
Avant toute collecte, définir les observations éligibles, le stockage accessible et l’exposition par décision, les règles de sélecteur/égalité/débordement, les invites livrées, le modèle et la version demandée/rapportée, les limites de ressource, la distribution monde/état initial, la réserve protégée, l’échéance, les attentes du noteur indépendant, la lignée échec/nouvelle tentative, la règle d’arrêt et l’analyse primaire. Faire correspondre les plafonds de ressource permis tout en rapportant la consommation réelle. Ne pas forcer les trajectoires monde/observation post-intervention à rester égales ; ces différences peuvent porter l’effet étudié.
Utiliser des épisodes complets comme unités, avec des blocs ou paires de tâches déclarés. Les mondes partagés avec des résidents en interaction exigent des unités groupe/monde. Énoncer le dénominateur de tous les épisodes lancés et le traitement des résultats indisponibles avant de regarder les résultats. Une graine commune ne garantit pas une aléatoire de modèle correspondante après divergence des trajectoires. Choisir un effet significatif ou une cible de précision et évaluer la sensibilité de la taille d’échantillon sous des hypothèses défendables ; ces quantités restent non fixées ici. C’est une étude proposée, non un préenregistrement ni un résultat empirique achevé.
9. Reproduction et disponibilité
La source sous-jacente et les enregistrements d’exécution restent privés. Cette édition de lecture conserve les assertions scientifiques et les valeurs enregistrées du brouillon examiné en interne. Les références locales de source et d’audit dans le texte nomment des enregistrements de ce paquet privé ; ce ne sont pas des liens publics d’artefacts.
Les deux figures SVG sont redessinées à partir des valeurs d’extraction et de comparaison acceptées pour ce site. Les valeurs des figures permettent d’inspecter les points tracés. Reconstruire une figure n’est pas relire le monde. Ces valeurs dérivées ne remplacent pas la source sous-jacente, les enregistrements d’épisode ni le noteur indépendant.
Une publication de recherche publique exige encore une paternité responsable, un paquet figé source/données et caviardage, des liens d’artefacts stables et un examen de ce paquet de publication. Ils n’ont pas été attribués ni publiés ici. L’examen interne achevé couvre le manuscrit technique et ses figures ; ce n’est ni une relecture par les pairs d’une revue ni une exécution indépendante de l’appareil. Les corrections restent partie de l’enregistrement de recherche.
Historique des révisions
9 septembre 2026. Édition de lecture web du brouillon technique examiné en interne. Les assertions scientifiques et les valeurs enregistrées sont conservées. Les liens vers le système de fichiers local sont omis ; les deux figures sont redessinées à partir des mêmes valeurs enregistrées pour une surface de lecture sombre. Source et enregistrements d’exécution restent privés. Ce n’est ni une publication publique d’artefacts ni une relecture par les pairs d’une revue. Les interfaces incluent une traduction complète de cette édition de lecture ; le texte anglais demeure l’original.
Kurzfassung
Begrenztes Gedächtnis kann künftige Handlungen eines Agenten ändern, aber das Speichern eines vergangenen Fehlers begründet kein Lernen und garantiert nicht, dass die Information genutzt wird. Wir prüfen einen bestehenden ORIGIN-Versuchsaufbau, in dem zwei deterministische Selektoren einer festen Entscheidungsregel unterschiedliche vergangene Erfahrungen zeigen. Ein Bewohner handelt in einem verfassten ressourcenbeschränkten Einzugsgebiet über 16 Entscheidungen und muss mit mindestens fünf Reserveeinheiten enden. Beide Selektoren erlauben zwei Datensätze und höchstens 8192 kanonische UTF-8-Bytes. Die archivierte Episode responsive-priority erreicht die Verpflichtung; das Recency-Gegenstück nicht. Zwei Kontrollen, die die ausgewählte Erinnerung ignorieren, folgen identischen Handlungs-/Zustandsfolgen und verfehlen beide die Verpflichtung. Die entscheidende Abhängigkeit ist ausdrücklich verfasst: Recency behält einen beobachteten Hindernisreiz, aber der Entscheidungs-5-Zweig der Regel reagiert eigens auf ein erinnertes stalled collect. Der Bericht dokumentiert daher einen begrenzten Mechanismus und die Grenzen seiner Prüfung. Er schätzt keinen Populationseffekt und zeigt kein LLM-Lernen, keine Motivation, kein Überleben und keine Artengleichheit. Getrennte Null-/Ungünstige-Entwicklungsvergleiche bleiben erhalten; wir geben an, was eine spätere empirische Studie bräuchte.
Begriffe
ORIGIN
Eigenname des Projekts. Wird nicht übersetzt.
Sol-III
Eigenname der verfassten Einzugsgebietswelt. Wird nicht übersetzt.
verzögerte Verpflichtung [delayed obligation]
Anforderung, die erst nach Entscheidung 15 bewertet wird: endgültige Reserve mindestens fünf. Ein früheres Überschreiten von fünf ist keine Erfüllung.
stockende Sammlung [stalled collect]
Eine collect-Handlung ohne sichtbare Reservezunahme, einschließlich einer Abnahme. Prädikat des Selektors; benennt keine verborgene Ursache. Quellkennung: stalledCollect.
Selektor [selector]
Die Richtlinie, die wählt, welche archivierten Datensätze ein Bewohner sehen darf. Hier: priority gegen recency, jeweils begrenzt auf zwei Datensätze und 8192 UTF-8-Bytes.
Versuchsaufbau [apparatus]
Die bereits aufgezeichnete deterministische Anordnung: Welt, Selektoren, Anbieter, Prüfer und gespeicherte Episoden. Dieser Bericht liest sie; er führt sie nicht erneut aus.
Bewohner [resident]
Der handelnde Agent im Einzugsgebiet. Kein biologischer Organismus; Reserve null ist nicht Tod.
Reserve [reserve]
Der endliche Ressourcenzähler in der verfassten Welt. Die verzögerte Verpflichtung verlangt endgültige Reserve ≥ 5.
1. Die Frage und die Evidenz
Die Forschungsfrage ist, ob die Priorisierung selbst beobachteter Fehlhandlungs-Erfahrungen eines Bewohners gegenüber rezenten Erfahrungen bei gleicher Gedächtniskapazität die Erfüllung einer verzögerten Verpflichtung ändert — und unter welchen Bedingungen das Erinnern dieser Erfahrungen das Verhalten unverändert lässt. Die gegenwärtige Antwort beschränkt sich auf einen bereits abgeschlossenen deterministischen Versuchsaufbau. Sie ist nützlich, weil ausgewählte Information, regelabhängige Handlung, autoritative Weltänderung und Ergebnis getrennt geprüft werden können.
Der Versuchsaufbau war vor dieser Forschungsaufnahme abgeschlossen. Dieser Bericht liest Quelle, angenommene Aufzeichnungen, sieben gespeicherte Episoden und die abgeleitete Entscheidungstabelle. Er fügt eine Quellen-/Aufzeichnungsprüfung und aus diesen gespeicherten Daten abgeleitete Abbildungen hinzu. Er führt weder die Welt noch einen Go-Test oder -Prüfer, ein lebendes Modell oder ein Hardware-Experiment aus. Vier externe Forschungsnotizen lieferten Kandidatenfragen und Quellen; ihre Antworten sind keine empirische Evidenz. Die begleitende Anspruchs-/Quellentabelle unterscheidet originale Befunde, lokale Beobachtungen, Hypothesen und unprüfte Hinweise.
„Fehler“ braucht eine operationale Definition. Das Prädikat des Selektors ist eine collect-Handlung ohne sichtbare Reservezunahme, einschließlich einer Abnahme. Es benennt keine verborgene Kausalerklärung und behauptet nicht, die Handlung sei zurückgewiesen worden. „Verzögert“ meint Folgen früherer Handlungen für spätere Ressourcenverfügbarkeit und eine Verpflichtung, die erst nach Entscheidung 15 bewertet wird. „Langfristig“ bezeichnet diesen endlichen Horizont; es meint keine unbefristete Bereitstellung. Diese Definitionen folgen dem implementierten Selektor und dem Vertrag des Versuchsaufbaus.
2. Der abgeschlossene Versuchsaufbau
Das bestehende Sol-III-current-Einzugsgebiet ist eine verfasste, dimensionslose Welt. Die Quelle setzt Anfangsreserve 4, effort 1, gespeicherte Ressource 2 und ein Hindernis. Reserve, effort und Speicher haben endliche Deckel. Der Bewohner wählt unter inspect, collect, clear und rest. Räumen ändert den Hinderniszustand und damit spätere Regenaufnahme. Die gegenwärtige Wahrnehmung zeigt Reserve, effort und eine Beobachtungsablesung; sie zeigt nicht jede Weltvariable direkt. Ressourcen- und Lebenszyklusdeklarationen machen Reserve null nicht zum Tod: Bewohner können bei null weiterhandeln. Der gemessene Endpunkt ist daher Versorgung zu einer Frist, nicht Überleben. Das sind Beschreibungen auf Quellebene von world.go, keine Ansprüche biologischer Realistik.
Jeder Gedächtnisdatensatz bindet die tatsächliche Wahrnehmung eines Bewohners vor der Handlung, die gewählte Handlung und die gelieferte Wahrnehmung danach an eine Episode-/Lauf-Linie. Nur vollständige frühere Datensätze sind zulässig. Der Selektor priority reiht zuerst collects mit nichtpositiver beobachteter Reserveänderung, füllt dann nach Recency. Der Vergleicher reiht nur nach Recency. Beide geben ausgewählte Datensätze chronologisch zurück, überspringen übergroße Kandidaten und deckeln das gesamte ausgewählte Array auf zwei Datensätze und 8192 Bytes. Die Auswahl aktualisiert keine Modellgewichte. Der Wirt behält das größere Archiv und Auslassungsbelege; das bewohnerseitige Gedächtnisbudget gilt für die ausgewählte Exposition, nicht für den gesamten Rechnerspeicher.
Beide responsiven Arme nutzen denselben zustandslosen verfassten Anbieter. Seine Regel hat eine ausdrückliche Uhr: bei Entscheidung 5, entsprechend elf verbleibenden Entscheidungen einschließlich der aktuellen, räumt sie nur, wenn sichtbares effort mindestens drei ist und die ausgewählte Erinnerung ein stalled collect enthält. Sie ruht durch das mittlere Intervall und sammelt mit positivem effort in den letzten vier Entscheidungen. Andere frühere Zweige reagieren auf Gedächtnis und gegenwärtige Wahrnehmung. Das Experiment verlangt daher von keinem Modell, eine Strategie zu entdecken. Die Anbieterquelle macht die Abhängigkeit prüfbar.
Zwei insensitive-Kontrollen sammeln, wenn das gegenwärtige effort positiv ist, sonst ruhen sie, ohne ausgewählte Erinnerung zu nutzen. Drei wörtliche Zeitpläne prüfen einen erfolgreichen Pfad, denselben Pfad mit Räumen bei Entscheidung 5 durch rest ersetzt, und durchgehendes Ruhen. Das verzögerte Ziel ist nur erfüllt, wenn eine vollständige, gültige 16-Entscheidungs-Episode eine endgültige Reserve von mindestens fünf hat. Ein früheres Überschreiten von fünf reicht nicht.
Der aufgezeichnete Prüfer rekonstruiert vor der Bewertung die Entsprechung unter Manifesten, Journalen, Versuchen, Anfragen, ausgewählten Erinnerungen, Handlungen, Beobachtungen und Endtatsachen. Er ist anbieterfrei; der Bewohner selbst nutzt weiter einen verfassten Anbieter. Eine gültige verfehlte Verpflichtung ist von ungültiger oder unvollständiger Evidenz verschieden. Diese Unterscheidung verhindert, dass ein Zielversagen still als ungültiger Datensatz verworfen wird und dass eine wohlgeformte Spur für ein erfolgreiches Ergebnis gehalten wird.
3. Ergebnisse in den gespeicherten Bedingungen
Die sieben aufgezeichneten Bedingungen enthalten je 16 Entscheidungen. Ihre 112 Entscheidungszeilen sind geschachtelte Messungen, keine 112 unabhängigen Stichproben. Die folgenden Werte wurden aus gespeicherten Lauf-/Prüfzusammenfassungen gelesen und gegen die zugehörigen extrahierten Endzustände geprüft. Es sind beschreibende Ergebnisse fester Bedingungen, ohne stichprobenbasiertes Intervall oder p-Wert. Gespeicherte Ergebnisse, Entscheidungsextraktion.
Bedingung
Endgültige Reserve
Terminale Verpflichtung
responsive-priority
5
Erfüllt
responsive-recency
0
Verfehlt
insensitive-priority
0
Verfehlt
insensitive-recency
0
Verfehlt
literal-success-priority
5
Erfüllt
literal-no-clear-priority
0
Verfehlt
literal-all-rest-priority
0
Verfehlt
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Abbildung 1. Bereits verfasste Trajektorien. Das responsive Paar unterscheidet sich an der Räumungsentscheidung und danach in der Reserve. Das insensitive Paar hat identische Handlungen und Zustände. Die Anforderung gilt nur bei Entscheidung 15; Reserve fünf bei Entscheidung 0 ist keine Erfüllung. Linien verbinden aufgezeichnete Entscheidungszustände und bezeichnen keine zusätzlichen Beobachtungen.
Bei Entscheidung 5 behält priority die Erfahrungen [1,4] und räumt; recency behält [3,4] und ruht. Ihre ausgewählten Gedächtnisarrays enthalten 2693 bzw. 2692 Bytes, die erfassten Petition-JSON-Größen 5039 und 5038 Bytes. Gleiche Kapazitätsgrenzen implizieren daher keine identischen Bytezahlen oder LLM-Tokenkosten. Das sind Bytes, keine Tokenizer-Messungen. Quelle und gespeicherte Auswahl begründen an dieser Grenze einen Zwei-Datensatz-Engpass; sie begründen keinen bindenden 8192-Byte-Engpass.
Die zwei responsiven Episoden enden mit Reserve 5 und 0. Ihre wörtlichen Gegenstücke ergeben dieselben Reservetrajektorien; das Ersetzen des Räumens durch rest ändert das verzögerte Ergebnis in der verfassten Anordnung. Die zwei insensitiven Episoden haben identische 16-Schritt-Handlungs-/Zustandsfolgen trotz unterschiedlicher ausgewählter Erinnerungen. Das ist eine Kontrolle für die angegebene Entscheidungsregel, kein allgemeines Ergebnis, dass Gedächtnis nicht zählen könne.
4. Was die Differenz identifiziert
Die am stärksten gestützte Deutung ist bedingt: Eine Änderung der Auswahlrichtlinie ändert die Information, die dieser festen responsiven Regel zugeführt wird, ihre Handlung bei Entscheidung 5 und das gespeicherte Folgeergebnis. Die Abhängigkeit ist in die Regel konstruiert. Das Ergebnis identifiziert weder eine intrinsisch überlegene Gedächtnisrepräsentation noch spontanes Lernen.
Ein kritisches Detail ist im gespeicherten Recency-Träger sichtbar. Seine ausgewählten Gedächtnisbytes bei Entscheidung 5 enthalten Erfahrung 3, eine inspect-Handlung, deren Nachbeobachtung reading: 1 hat, das beobachtete Hindernissignal. Der Anbieter berechnet aus solchen Nachbeobachtungen eine Flagge, aber der Zweig der elf verbleibenden Entscheidungen prüft stattdessen stalledCollect. Er nutzt diese Hindernisflagge nicht, um an dieser Grenze das Räumen auszulösen. Folglich kann der unterlegene Recency-Arm nicht als ohne potenziell nützliche Warnung beschrieben werden. Das ist eine direkte Quellen-/Aufzeichnungsbeobachtung; die These, eine andere Richtlinie würde den Reiz nutzen, ist eine plausible alternative Erklärung zum Prüfen, kein hier neu ausgeführtes Experiment. Gespeicherter Recency-Träger, responsive Regel.
Der insensitive Vergleich hat ebenfalls eine behaltene Korrektur. Eine anfängliche Kontrolle erwartete unterschiedliche An-/Abwesenheit von stalled collects, aber beide Arme behielten eines. Die korrigierte Kontrolle betraf unterschiedliche behaltene Erfahrungen bei identischen Welttrajektorien. Das Behalten der ursprünglichen fehlgeschlagenen Erwartung verhindert, dass eine irrige Kontrollgeschichte in ein positives Ergebnis umgewandelt wird. Die angenommene Versuchsaufzeichnung dokumentiert diese Geschichte.
Keine Bedingung in dieser Menge isoliert die Notwendigkeit von Verzögerung oder Knappheit, indem sie sie variiert. Der Bericht beschreibt einen Mechanismus, der in ihrer Gegenwart wirkt. Er behauptet nicht, derselbe Selektor-Kontrast hänge einzig von einem der beiden Merkmale ab, oder er bestehe unter veralteten Fehlern, geänderten Voraussetzungen, anderen Richtlinien oder ungeprüften Welten fort.
5. Die Prüfung ist selbst ein Evidenzgegenstand
Anbieterausführung und strenges Wiedergeben teilen eine verfasste Regel. Ihre Übereinstimmung kann Konsistenz begründen und dabei eine gemeinsame Abweichung vom dokumentierten Vertrag verfehlen. Eine bewahrte private falsche Variante verkürzte das letzte Sammelfenster von vier Entscheidungen auf drei; die strenge Prüfung jener Kopie nahm die Episode an, während Entscheidung 12 inspect statt des unabhängig erwarteten collect zurückgab. Die ursprüngliche Produktregel war korrekt. Die Reserve vier der geänderten Richtlinie ist kein ungünstiges Selektorergebnis.
Ein additiver Test lieferte dann zwölf wörtliche Erwartungen über Entscheidungen 11, 12 und 15, positives/null effort und leere/behaltene stalled-collect-Erinnerung. Historische Protokolle verzeichnen das unveränderte Bestehen der Kontrolle und das Scheitern dreier kompilierender falscher Varianten an den vorgesehenen Zusicherungen. In dieser Forschungsaufnahme stimmten alle acht Implementierungs-Protokoll-Hashes und der aktuelle Testdatei-Hash mit ihren aufgezeichneten Werten überein, und die einschlägigen Fehlwahlmeldungen wurden geprüft. Das sind frische Integritäts-/Leseprüfungen historischer Evidenz, keine frisch ausgeführten Tests. Annahmeprüfung, wörtlicher Test, aufgezeichnete Befehle und Protokolle.
Aktuelle Byteprüfungen glichen auch alle 140 gespeicherten Episodendateien mit den sieben bestehenden Quittungen und alle 95 archivierten Quellen-/Moduleinträge mit dem responsive-priority-Manifest ab. Das stützt die Integrität des geprüften Pakets. Es bezeugt nicht, welches Binär ursprünglich lief, begründet nicht, dass jede Compilereingabe archiviert ist, und ersetzt keine frische unabhängige Reproduktion. Der Bericht bewahrt die dokumentierte Grenze der Quellenfindung: kompilierte Nutzung erfordert den Quellen-Checkout auf seinem Build-Pfad und einen Build ohne -trimpath. Ansprüche voller Infrastruktur, Absturz-Wiederherstellung und repositoryweiter Korrektheit bleiben außerhalb dieser Aufzeichnung.
6. Gesonderte frühere Entwicklungsevidenz
Der ältere Datensatz zur Artikelbereitschaft enthält acht verfasste Trajektorien, 128 geschachtelte Momente und vier adaptive/baseline-Profilvergleiche. Die Metrik ist die Summe der getragenen Reserve nach jedem ProcessMoment über die Momente 0–15, gemessen in Reserve-Einheiten-Momenten. Die Differenzen adaptive minus baseline sind +4, 0, 0 und −1. Sie sind nicht die priority/recency-Intervention oben und teilen deren terminalen Endpunkt nicht. Definitionen, vier Vergleiche.
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Abbildung 2. Alle vier früheren festen Profilvergleiche mit ihrer ursprünglichen kumulativen Metrik. Negative und Nullwerte bleiben erhalten. Diese Abbildung ist gesonderter Entwicklungskontext; sie ist keine zusätzliche Stichprobe zu Abbildung 1.
Zwei historische Machbarkeitsversuche mit lokalem Modell und zwei Zeilen Apparattopologie sind in jener älteren Aufnahme ebenfalls katalogisiert. Keine kann den sieben deterministischen Bedingungen hinzugefügt werden, um eine Verhaltensstichprobe zu vergrößern. Wiedergaben, Wiederholungen, Neubewertungen und mehrere Zeilen einer Trajektorie behalten ihre Linie. Die älteren Profile current, shifted, clustered und sparse sind bereits geprüft und können durch Umbenennen keine blinde Rücklage werden.
7. Stellung in der Literatur
Gedächtnissysteme kombinieren Interventionen, die zu unterscheiden sind. Generative Agents kombiniert Abruffaktoren einschließlich zugriffsbasierter Recency, Wichtigkeit und Relevanz; seine Interview-Ablationen nutzen von der vollen Architektur angesammelte Geschichten. Jene Auswertung motiviert, Entscheidungssonden gemeinsamer Geschichte von vollständigen Trajektorieninterventionen zu trennen. Sie validiert dieses Einzugsgebietsergebnis nicht. Park et al., 2023, §§4.1 and 6.1–6.2.
Reflexion ändert späteren Kontext durch textuelles Feedback, nicht durch Änderung der Basis-Modellgewichte. Sein WebShop-Anhang berichtet auch eine Einstellung, in der die versuchte Verbesserung nicht eintrat. Mechanismus und jene Grenze sprechen dagegen, Gedächtnis oder Reflexion als unbedingten Nutzen zu behandeln. Sie betreffen andere Aufgaben und Versuchsstrukturen als dieser Versuchsaufbau. Shinn et al., 2023, abstract and Appendix B.1.
Für eine spätere empirische Studie muss der Stichprobenumfang einem inferenziellen Ziel und begründeten Annahmen folgen. Präzisionsplanung etwa verlangt eine Zielintervallbreite und eine Darstellung der Variabilität; keine Arbeit liefert eine universell ausreichende Zahl von ORIGIN-Läufen. Lakens, 2022, “Planning for Precision”.
Artefaktverfügbarkeit/-funktionalität und unabhängig gewonnene Ergebnisse sind in der ACM-Artefaktterminologie getrennte Leistungen. Dieser Bericht bietet eine lokale Integritätsprüfung und eine reproduzierbare Ableitung der Abbildungen; er beansprucht kein Prüfabzeichen und keine unabhängige experimentelle Replikation. ACM SIGIR artifact criteria.
LongMemEval bewertet Lesestrategien mit orakelabgerufener Evidenz und zeigt, dass das Leserdesign die QA-Leistung auch dann beeinflusst, wenn die Evidenzsitzungen geliefert werden. Das stärkt die Unterscheidung von Abruf und Nutzung in einer Chatverlauf-QA-Aufgabe. Es misst keine Handlung in einer persistenten Welt. Wu et al., v2, §5.5.
XENON koppelt Erfahrungsgedächtnis an Abhängigkeitskorrektur und Kandidatenhandlungs-Korrektur. Es ist daher eine Referenz für eine andere Intervention als die Änderung der Episodenexposition bei festem Wähler dieses Versuchsaufbaus. Lee et al., v3, §§4.1–4.2.
Vending-Bench trennt Grenzen des rezenten Kontexts von externen Gedächtniswerkzeugen ohne ausdrückliche Speicherbeschränkungen. Seine ursprüngliche GPT-4o-mini-Kontextkapazitäts-Ablation berichtet schlechtere Ergebnisse bei größeren Grenzen. Das warnt davor, jede Gedächtnisschicht als ein Budget zu behandeln oder monotonem Nutzen anzunehmen; sein Geschäftsfeld und historische Modelle sind keine ORIGIN-Ergebnisse. Backlund and Petersson, v1, §§2.1 and 3.5.2.
Die Few-Run-RL-Analyse von Agarwal und Kollegen betrifft Variabilität über stochastische Trainings-/Auswertungsläufe. Ihre statistischen Empfehlungen erfordern eine passende Stichprobenstruktur und liefern keine Konfidenzintervalle für diese sieben verfassten Bedingungen. Agarwal et al., NeurIPS 2021.
Menschliche/nichtmenschliche und Rechen-/Quantenbefunde bleiben getrennte Portfolioeingaben, keine Evidenz für das gegenwärtige Ergebnis. Die Quellenfeststellung zeichnet den zugelassenen Umfang und Korrekturen zu überengen oder unvollständigen Sammelzusammenfassungen auf.
8. Eine falsifizierbare Fortsetzung
Eine nächste empirische Frage könnte lauten, ob der Selektor-Kontrast die Zielwahrscheinlichkeit vollständiger Episoden für eine erklärte Modell-/Aufgabenverteilung ändert. Die Richtung muss offen bleiben. Ein nützliches negatives Ergebnis würde einen einschlägigen Fehlerdatensatz behalten, ohne die gewählte Handlung oder das terminale Ergebnis zu verbessern; ein schädliches Ergebnis wäre ebenfalls aufschlussreich. Die gegenwärtige Quellenprüfung motiviert zusätzlich, Behalten vom Hinweisnutzungsvertrag der Entscheidungsregel zu unterscheiden.
Vor jeder Erhebung sind die zulässigen Beobachtungen, zugänglicher Speicher und Exposition je Entscheidung, Selektor-/Gleichstands-/Überlaufregeln, gelieferte Prompts, Modell und angeforderte/berichtete Version, Ressourcengrenzen, Welt-/Anfangszustandsverteilung, geschützte Rücklage, Frist, Erwartungen des unabhängigen Bewerters, Fehler-/Wiederholungslinie, Stoppregel und Primäranalyse festzulegen. Die erlaubten Ressourcendeckel sind einzuhalten und der tatsächliche Verbrauch zu berichten. Nach-Interventions-Welt-/Beobachtungstrajektorien dürfen nicht zur Gleichheit gezwungen werden; jene Differenzen können den untersuchten Effekt tragen.
Vollständige Episoden als Einheiten nutzen, mit erklärten Aufgabenblöcken oder -paaren. Geteilte Welten mit interagierenden Bewohnern erfordern Gruppen-/Welteinheiten. Den Nenner aller gestarteten Episoden und den Umgang mit nicht verfügbaren Ergebnissen vor dem Blick auf die Resultate angeben. Ein gemeinsamer Samen garantiert nach Auseinanderlaufen der Trajektorien keine entsprechende Modellzufälligkeit. Eine sinnvolle Effekt- oder Präzisionszielgröße wählen und die Empfindlichkeit des Stichprobenumfangs unter vertretbaren Annahmen prüfen; diese Größen bleiben hier ungesetzt. Das ist eine vorgeschlagene Studie, keine Präregistrierung und kein abgeschlossenes empirisches Ergebnis.
9. Reproduktion und Verfügbarkeit
Die zugrunde liegende Quelle und die Laufzeitaufzeichnungen bleiben privat. Diese Leseausgabe bewahrt die wissenschaftlichen Ansprüche und aufgezeichneten Werte des intern geprüften Entwurfs. Örtliche Quellen- und Prüfungsbezüge im Text nennen Aufzeichnungen in jenem privaten Paket; sie sind keine öffentlichen Artefaktlinks.
Die zwei SVG-Abbildungen sind aus den für diese Website angenommenen Extraktions- und Vergleichswerten neu gezeichnet. Abbildungswerte stehen zur Prüfung der gezeichneten Punkte bereit. Eine Abbildung neu zu bauen ist etwas anderes als die Welt wiederzugeben. Diese abgeleiteten Werte ersetzen weder die zugrunde liegende Quelle noch die Episodenaufzeichnungen noch den unabhängigen Bewerter.
Eine öffentliche Forschungsfreigabe verlangt weiterhin zurechenbare Urheberschaft, ein eingefrorenes Quellen-/Daten- und Schwärzungspaket, stabile Artefaktlinks und Prüfung jenes Freigabepakets. Die sind hier weder zugewiesen noch freigegeben. Die abgeschlossene interne Prüfung deckt das technische Manuskript und seine Abbildungen; sie ist keine Zeitschriften-Peer-Review und keine unabhängige Ausführung des Versuchsaufbaus. Korrekturen bleiben Teil der Forschungsaufzeichnung.
Revisionsgeschichte
9. September 2026. Webleseausgabe des intern geprüften technischen Entwurfs. Wissenschaftliche Ansprüche und aufgezeichnete Werte bleiben erhalten. Örtliche Dateisystemlinks entfallen; die zwei Abbildungen sind aus denselben aufgezeichneten Werten für eine dunkle Lesefläche neu gezeichnet. Quelle und Laufzeitaufzeichnungen bleiben privat. Das ist keine öffentliche Artefaktfreigabe und keine Zeitschriften-Peer-Review. Die Oberflächen enthalten eine vollständige Übersetzung dieser Leseausgabe; der englische Text bleibt das Original.
Аннотация
Ограниченная память может изменить будущие действия агента, но сохранение прошлой неудачи не устанавливает обучение и не гарантирует, что сведения будут использованы. Мы разбираем существующую установку ORIGIN, в которой два детерминированных селектора предъявляют фиксированному правилу решения разные прошлые опыты. Один житель действует в составленном водосборе с ограниченным ресурсом 16 решений и должен закончить не менее чем с пятью единицами резерва. Оба селектора допускают две записи и не более 8192 канонических байт UTF-8. Архивный эпизод responsive-priority достигает обязательства; его recency-пара — нет. Два контроля, игнорирующие выбранную память, следуют одинаковым последовательностям действие/состояние и оба не выполняют обязательство. Решающая зависимость явно составлена: recency удерживает наблюдаемый сигнал препятствия, но ветвь правила на решении 5 отвечает именно на запомненный stalled collect. Отчёт поэтому фиксирует ограниченный механизм и пределы его проверки. Он не оценивает популяционный эффект и не демонстрирует обучение LLM, мотивацию, выживание или межвидовую эквивалентность. Мы сохраняем отдельные нулевые/неблагоприятные сравнения разработки и указываем, что понадобилось бы позднейшему эмпирическому исследованию.
Термины
ORIGIN
Собственное имя проекта. Не переводится.
Sol-III
Собственное имя составленного мира водосбора. Не переводится.
отложенное обязательство [delayed obligation]
Требование, оцениваемое только после решения 15: итоговый резерв не меньше пяти. Превышение пяти раньше не есть завершение.
застопорившийся сбор [stalled collect]
Действие collect без видимого роста резерва, включая снижение. Предикат селектора; скрытую причину не именует. Идентификатор источника: stalledCollect.
селектор [selector]
Политика выбора архивных записей, которые может видеть житель. Здесь: priority против recency, у каждого предел в две записи и 8192 байта UTF-8.
установка [apparatus]
Уже записанная детерминированная установка: мир, селекторы, поставщик, верификатор и сохранённые эпизоды. Этот отчёт её читает, а не перезапускает.
житель [resident]
Действующий агент в водосборе. Это не биологический организм; нулевой резерв не есть смерть.
резерв [reserve]
Конечный счётчик ресурса в составленном мире. Отложенное обязательство требует итоговый резерв ≥ 5.
1. Вопрос и свидетельства
Исследовательский вопрос: меняет ли при той же ёмкости памяти приоритет собственных наблюдённых опытов неудачного действия жителя над недавними опытами выполнение отложенного обязательства — и при каких условиях помнение этих опытов оставляет поведение неизменным. Нынешний ответ ограничен уже завершённой детерминированной установкой. Он полезен тем, что выбранные сведения, действие по правилу, авторитетное изменение мира и исход можно разобрать по отдельности.
Установка была завершена до этой исследовательской приёмки. Отчёт читает её исходник, принятые записи, семь сохранённых эпизодов и производную таблицу решений. Он добавляет аудит исходника/записей и рисунки, выведенные из этих сохранённых данных. Он не исполняет мир, Go-тест или верификатор, живую модель или аппаратный эксперимент. Четыре внешних исследовательских записки дали кандидатные вопросы и источники; их ответы не эмпирические свидетельства. Сопровождающая таблица утверждений/источников различает оригинальные находки, локальные наблюдения, гипотезы и непроверенные зацепки.
«Неудача» требует операционального определения. Предикат селектора — действие collect без видимого роста резерва, включая снижение. Он не указывает скрытое причинное объяснение и не утверждает, что действие отвергнуто. «Отложенное» относится к последствиям более ранних действий для позднейшей доступности ресурса и к обязательству, оцениваемому только после решения 15. «Долгосрочное» обозначает этот конечный горизонт, а не бессрочное развёртывание. Эти определения следуют реализованному селектору и договору установки.
2. Завершённая установка
Существующий водосбор Sol-III current — составленный безразмерный мир. Исходник задаёт начальный резерв 4, effort 1, запасённый ресурс 2 и препятствие. У резерва, effort и склада конечные потолки. Житель выбирает среди inspect, collect, clear и rest. Очистка меняет состояние препятствия и тем самым позднейший захват дождя. Текущее восприятие показывает резерв, effort и отсчёт наблюдения; оно не показывает напрямую каждую переменную мира. Объявления ресурса и жизненного цикла не превращают нулевой резерв в смерть: жители могут продолжать действовать при нуле. Измеряемая конечная точка поэтому — снабжение к сроку, не выживание. Это описания на уровне исходника world.go, а не притязания на биологический реализм.
Каждая запись памяти связывает фактическое восприятие жителя до действия, выбранное действие и доставленное восприятие после действия с линией эпизода/прогона. Допустимы только полные предшествующие записи. Селектор priority сначала ранжирует collect с неположительным наблюдённым изменением резерва, затем заполняет по recency. Компаратор ранжирует только по recency. Оба возвращают выбранные записи хронологически, пропускают чрезмерные кандидаты и ограничивают весь выбранный массив двумя записями и 8192 байтами. Выбор не обновляет веса модели. Хост сохраняет больший архив и свидетельства пропуска; бюджет памяти, обращённый к жителю, относится к выбранному предъявлению, а не к полному хранилищу компьютера.
Обе отзывчивые ветви используют одного и того же бессостоятельного составленного поставщика. У его правила явные часы: на решении 5, что соответствует одиннадцати оставшимся решениям включая текущее, оно очищает только если видимый effort не меньше трёх и выбранная память содержит stalled collect. Оно отдыхает в среднем интервале и собирает при положительном effort в последние четыре решения. Другие более ранние ветви отвечают на память и текущее восприятие. Таким образом эксперимент не просит модель открыть стратегию. Исходник поставщика делает зависимость проверяемой.
Два контроля insensitive собирают, когда текущий effort положителен, иначе отдыхают, не используя выбранную память. Три буквальных расписания проверяют успешный путь, тот путь с очисткой на решении 5, заменённой rest, и поведение сплошного rest. Отложенная цель удовлетворена только когда полный действительный эпизод из 16 решений имеет итоговый резерв не меньше пяти. Пересечение пяти раньше недостаточно.
Записанный верификатор до оценки восстанавливает соответствие манифестов, журналов, попыток, запросов, выбранных памятей, действий, наблюдений и конечных фактов. Он свободен от поставщика; сам житель по-прежнему использует составленного поставщика. Действительное невыполненное обязательство отлично от недействительных или неполных свидетельств. Это различение мешает тихо отбросить провал цели как недействительную запись и принять правильно построенный след за успешный исход.
3. Результаты в сохранённых условиях
Семь записанных условий содержат по 16 решений. Их 112 строк решений — вложенные измерения, не 112 независимых выборок. Следующие значения прочитаны из сохранённых сводок прогона/проверки и сверены с соответствующими извлечёнными конечными состояниями. Это описательные результаты фиксированных условий без интервала или p-значения на основе выборки. Сохранённые результаты, извлечение решений.
Условие
Итоговый резерв
Конечное обязательство
responsive-priority
5
Выполнено
responsive-recency
0
Не выполнено
insensitive-priority
0
Не выполнено
insensitive-recency
0
Не выполнено
literal-success-priority
5
Выполнено
literal-no-clear-priority
0
Не выполнено
literal-all-rest-priority
0
Не выполнено
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Рисунок 1. Уже составленные траектории. Отзывчивая пара расходится на решении об очистке и далее в резерве. Нечувствительная пара имеет одинаковые действия и состояния. Требование действует только на решении 15; резерв пять на решении 0 не есть завершение. Линии соединяют записанные состояния решений и не обозначают дополнительных наблюдений.
На решении 5 priority удерживает опыты [1,4] и очищает; recency удерживает [3,4] и отдыхает. Их массивы выбранной памяти содержат 2693 и 2692 байта соответственно, а захваченные размеры Petition JSON — 5039 и 5038 байт. Равные потолки ёмкости поэтому не означают одинаковых чисел байт или затрат токенов LLM. Это байты, не измерения токенизатора. Исходник и сохранённый выбор устанавливают на этой границе узкое место из двух записей; они не устанавливают обязывающего узкого места в 8192 байта.
Два отзывчивых эпизода заканчиваются резервом 5 и 0. Их буквальные пары дают те же траектории резерва; замена очистки на rest меняет отложенный исход в составленной установке. Два нечувствительных эпизода имеют одинаковые 16-шаговые последовательности действие/состояние при разных выбранных памятях. Это контроль для указанного правила решения, а не общий результат, что память не может иметь значения.
4. Что выявляет различие
Наиболее поддержанное толкование условно: смена политики выбора меняет сведения, подаваемые этому фиксированному отзывчивому правилу, его действие на решении 5 и сохранённый последующий исход. Зависимость встроена в правило. Результат не выявляет внутренне превосходящего представления памяти и не спонтанного обучения.
В сохранённом носителе recency видна критическая подробность. Байты выбранной памяти на решении 5 включают опыт 3, действие inspect, чьё поснаблюдение имеет reading: 1, наблюдённый сигнал препятствия. Поставщик вычисляет флаг из таких поснаблюдений, но ветвь одиннадцати оставшихся решений проверяет вместо этого stalledCollect. Она не использует этот флаг препятствия, чтобы вызвать очистку на этой границе. Следовательно, проигравшую recency-ветвь нельзя описать как не имеющую потенциально полезного предупреждения. Это прямое наблюдение исходника/записи; положение, что другая политика использовала бы подсказку, — правдоподобное альтернативное объяснение для проверки, а не новый эксперимент, выполненный здесь. Сохранённый носитель recency, отзывчивое правило.
У нечувствительного сравнения также есть сохранённое исправление. Начальный контроль ожидал разного наличия/отсутствия stalled collect, но обе ветви удержали по одному. Исправленный контроль касался разных удержанных опытов при одинаковых траекториях мира. Сохранение исходного несбывшегося ожидания мешает превратить ошибочную контрольную историю в положительный результат. Принятая запись установки документирует эту историю.
Ни одно условие в этом наборе не изолирует необходимость задержки или дефицита, варьируя их. Отчёт описывает механизм, действующий при их наличии. Он не утверждает, что тот же контраст селекторов зависит единственно от какого-либо из этих свойств, или что он сохраняется при устаревших неудачах, изменённых предпосылках, иных политиках или неисследованных мирах.
5. Проверка сама есть предмет свидетельства
Исполнение поставщика и строгое воспроизведение разделяют составленное правило. Их согласие может установить согласованность, пропустив общее отклонение от задокументированного договора. Сохранённый частный неверный вариант сократил финальное окно сбора с четырёх решений до трёх; строгая проверка той копии приняла эпизод, тогда как решение 12 вернуло inspect вместо независимо ожидаемого collect. Исходное продуктовое правило было верным. Резерв четыре изменённой политики не есть неблагоприятный результат селектора.
Аддитивный тест затем дал двенадцать буквальных ожиданий по решениям 11, 12 и 15, положительному/нулевому effort и пустой/удержанной памяти stalled collect. Исторические журналы фиксируют прохождение неизменённого контроля и провал трёх компилируемых неверных вариантов на намеченных утверждениях. В этой исследовательской приёмке все восемь хешей журналов реализации и текущий хеш файла тестов совпали с записанными значениями, и соответствующие сообщения о неверном выборе были осмотрены. Это свежие проверки целостности/чтения исторических свидетельств, не свеже исполненные тесты. Аудит приёмки, буквальный тест, записанные команды и журналы.
Текущие проверки байт также сопоставили все 140 сохранённых файлов эпизодов с семью существующими квитанциями и все 95 архивных записей исходника/модуля с манифестом responsive-priority. Это поддерживает целостность осмотренного пакета. Оно не свидетельствует, какой двоичный файл изначально исполнялся, не устанавливает, что каждый вход компилятора архивирован, и не заменяет свежее независимое воспроизведение. Отчёт сохраняет задокументированное ограничение обнаружения исходника: скомпилированное использование требует checkout исходника на его пути сборки и сборки без -trimpath. Утверждения о полной инфраструктуре, восстановлении после сбоя и корректности всего репозитория остаются вне этой записи.
6. Отдельные более ранние свидетельства разработки
Более старый набор данных готовности статьи содержит восемь составленных траекторий, 128 вложенных моментов и четыре сравнения профилей adaptive/baseline. Метрика — сумма несомого резерва после каждого ProcessMoment по моментам 0–15, в момент-единицах резерва. Разности adaptive минус baseline равны +4, 0, 0 и −1. Это не вмешательство priority/recency выше, и они не разделяют его конечную точку. Определения, четыре сравнения.
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
Рисунок 2. Все четыре более ранних фиксированных сравнения профилей с исходной кумулятивной метрикой. Неблагоприятные и нулевые значения сохранены. Этот рисунок — отдельный контекст разработки; это не дополнительная выборка для рисунка 1.
В той более старой приёмке также каталогизированы два исторических испытания осуществимости локальной модели и две строки топологии установки. Ничто нельзя добавить к семи детерминированным условиям, чтобы расширить поведенческую выборку. Воспроизведения, повторы, пересчёт и несколько строк одной траектории сохраняют линию. Более старые профили current, shifted, clustered и sparse уже осмотрены и не могут стать слепым отложенным набором от переименования.
7. Место в литературе
Системы памяти сочетают вмешательства, которые следует различать. Generative Agents сочетает факторы извлечения, включая recency по доступу, важность и релевантность; его абляции интервью используют истории, накопленные полной архитектурой. Эта оценка побуждает отделять зонды решения общей истории от вмешательств полной траектории. Она не подтверждает этот результат водосбора. Park et al., 2023, §§4.1 and 6.1–6.2.
Reflexion меняет последующий контекст текстовой обратной связью, не меняя веса базовой модели. Приложение WebShop также сообщает обстановку, в которой задуманное улучшение не осуществилось. И механизм, и это ограничение против того, чтобы считать память или рефлексию безусловной пользой. Они касаются иных задач и структур проб, чем эта установка. Shinn et al., 2023, abstract and Appendix B.1.
Для позднейшего эмпирического исследования размер выборки должен следовать выводной цели и обоснованным допущениям. Планирование по точности, например, требует целевой ширины интервала и отчёта об изменчивости; ни одна статья не даёт универсально достаточного числа прогонов ORIGIN. Lakens, 2022, “Planning for Precision”.
Доступность/функциональность артефактов и независимо полученные результаты — отдельные достижения в терминологии артефактов ACM. Этот отчёт предлагает локальный аудит целостности и воспроизводимый вывод рисунков; он не притязает на знак рецензии или независимое экспериментальное воспроизведение. ACM SIGIR artifact criteria.
LongMemEval оценивает стратегии чтения с оракульно извлечёнными свидетельствами и показывает, что устройство читателя влияет на качество QA даже когда сеансы свидетельств поданы. Это усиливает различение извлечения и использования в задаче QA по истории чата. Оно не измеряет действие в устойчивом мире. Wu et al., v2, §5.5.
XENON связывает память опыта с исправлением зависимостей и исправлением действий-кандидатов. Это поэтому ссылка на иное вмешательство, чем смена предъявления эпизода при фиксированном выбирателе этой установки. Lee et al., v3, §§4.1–4.2.
Vending-Bench отделяет пределы недавнего контекста от внешних инструментов памяти без явных ограничений хранения. Исходная абляция ёмкости контекста GPT-4o-mini сообщает худшие исходы при больших пределах. Это предостерегает не считать каждый слой памяти одним бюджетом и не предполагать монотонной пользы; его деловая область и исторические модели не результаты ORIGIN. Backlund and Petersson, v1, §§2.1 and 3.5.2.
Анализ RL с малым числом прогонов Агарвала и коллег касается изменчивости по стохастическим прогонам обучения/оценки. Его статистические рекомендации требуют подходящей выборочной структуры и не дают доверительных интервалов для этих семи составленных условий. Agarwal et al., NeurIPS 2021.
Человеческие/нечеловеческие и вычислительные/квантовые находки остаются отдельными входами портфеля, не свидетельством настоящего результата. Разбор источников фиксирует допущенный охват и исправления слишком узких или неполных сводок сбора.
8. Фальсифицируемое продолжение
Следующий эмпирический вопрос мог бы спрашивать, меняет ли контраст селекторов вероятность цели полного эпизода для заявленного распределения модели/задачи. Направление должно оставаться открытым. Полезный отрицательный результат удержал бы относящуюся неудачу без улучшения выбранного действия или конечного исхода; вредный результат также был бы информативен. Нынешний осмотр исходника дополнительно побуждает отличать удержание от договора использования подсказки правила решения.
До любого сбора определить допустимые наблюдения, доступное хранилище и предъявление на решение, правила селектора/ничьей/переполнения, доставленные подсказки, модель и запрошенную/сообщённую версию, пределы ресурса, распределение мира/начального состояния, защищённый отложенный набор, срок, ожидания независимого оценщика, линию неудачи/повтора, правило остановки и первичный анализ. Сопоставлять разрешённые потолки ресурса, сообщая фактическое потребление. Не принуждать после-вмешательственные траектории мира/наблюдения оставаться равными; эти различия могут нести изучаемый эффект.
Использовать полные эпизоды как единицы, с объявленными блоками или парами задач. Общие миры с взаимодействующими жителями требуют единиц группы/мира. Указать знаменатель всех запущенных эпизодов и обращение с недоступными исходами до просмотра результатов. Общее зерно не гарантирует соответствующего случайности модели после расхождения траекторий. Выбрать значимый эффект или цель точности и оценить чувствительность размера выборки при защитимых допущениях; эти величины здесь не заданы. Это предложенное исследование, не пререгистрация и не завершённый эмпирический результат.
9. Воспроизведение и доступность
Лежащий в основе исходник и записи выполнения остаются закрытыми. Это читательское издание сохраняет научные утверждения и записанные значения внутренне рассмотренного черновика. Местные ссылки на исходник и аудит в тексте именуют записи в том закрытом пакете; это не публичные ссылки на артефакты.
Два рисунка SVG перерисованы из принятых для этого сайта значений извлечения и сравнения. Значения рисунков доступны для осмотра нанесённых точек. Перестройка рисунка отличается от воспроизведения мира. Эти производные значения не заменяют лежащий в основе исходник, записи эпизодов и независимого оценщика.
Публичный выпуск исследования по-прежнему требует подотчётного авторства, замороженного пакета исходника/данных и редактуры, стабильных ссылок на артефакты и разбора того пакета выпуска. Здесь они не назначены и не выпущены. Завершённый внутренний разбор покрывает техническую рукопись и её рисунки; это не журнальное рецензирование и не независимое исполнение установки. Исправления остаются частью исследовательской записи.
История правок
9 сентября 2026. Веб-читательское издание внутренне рассмотренного технического черновика. Научные утверждения и записанные значения сохранены. Ссылки на локальную файловую систему опущены; два рисунка перерисованы из тех же записанных значений для тёмной поверхности чтения. Исходник и записи выполнения остаются закрытыми. Это не публичный выпуск артефактов и не журнальное рецензирование. Интерфейсы включают полный перевод этого читательского издания; английский текст остаётся оригиналом.
الملخص
يمكن للذاكرة المحدودة أن تغيّر أفعال الفاعل لاحقاً، لكن حفظ إخفاق سابق لا يُثبت تعلّماً ولا يضمن استخدام المعلومة. نفحص جهازاً قائماً في ORIGIN يعرض فيه مُنتقيان حتميان خبرات ماضية مختلفة على قاعدة قرار ثابتة. يتصرّف مقيم واحد في حوض مؤلَّف مقيّد الموارد عبر 16 قراراً، وعليه أن ينتهي بما لا يقل عن خمس وحدات احتياطي. يسمح كل مُنتقٍ بسجلّين وبما لا يزيد على 8192 بايت UTF-8 قانوني. تبلغ حلقة responsive-priority المؤرشفة الالتزام؛ ولا تبلغه مقابلة الحداثة. يتبع ضابطان يتجاهلان الذاكرة المختارة تسلسلات فعل/حالة متطابقة ويُخفق كلاهما في الالتزام. التبعية الحاسمة مؤلَّفة صراحة: تحتفظ الحداثة بإشارة عائق مرصودة، لكن فرع القاعدة عند القرار 5 يستجيب خصوصاً لجمع متوقف [stalled collect] مُتذكَّر. يوثّق التقرير إذاً آلية محدودة وحدود التحقق منها. وهو لا يقدّر أثراً مجتمعياً ولا يُظهر تعلّم نماذج لغوية كبيرة ولا دافعاً ولا بقاءً ولا تكافؤاً بين الأنواع. نُبقي مقارنات تطوير صفرية/معاكسة منفصلة ونحدّد ما تحتاج إليه دراسة تجريبية لاحقة.
المصطلحات
ORIGIN
اسم علم للمشروع. لا يُترجم.
Sol-III
اسم علم لعالم الحوض المؤلَّف. لا يُترجم.
التزام مؤجّل [delayed obligation]
شرط يُحتسب فقط بعد القرار 15: احتياطي نهائي لا يقل عن خمسة. تجاوز الخمسة قبل ذلك ليس إتماماً.
جمع متوقف [stalled collect]
فعل collect دون زيادة مرئية في الاحتياطي، بما في ذلك النقصان. محمول المُنتقي؛ لا يسمّي سبباً خفياً. معرّف المصدر: stalledCollect.
مُنتقٍ [selector]
السياسة التي تختار أي السجلات المؤرشفة يجوز للمقيم رؤيتها. هنا: priority مقابل recency، وكلّ منهما محدود بسجلّين و8192 بايت UTF-8.
جهاز تجريبي [apparatus]
التركيب الحتمي المسجّل سلفاً: العالم، والمُنتقِيات، والمزوّد، والمدقّق، والحلقات المحفوظة. يقرأ هذا التقرير ذلك التركيب ولا يعيد تشغيله.
مقيم [resident]
الفاعل في الحوض. ليس كائناً بيولوجياً، والاحتياطي الصفري ليس موتاً.
احتياطي [reserve]
عدّاد المورد المحدود في العالم المؤلَّف. يتطلّب الالتزام المؤجّل احتياطياً نهائياً ≥ 5.
1. السؤال والشاهد
سؤال البحث هو ما إذا كان تقديم خبرات الفعل الفاشل التي رصدها المقيم نفسه على الخبرات الحديثة، عند السعة نفسها، يغيّر إتمام التزام مؤجّل—وفي أي شروط يترك تذكّر تلك الخبرات السلوك بلا تغيير. الجواب الحالي مقصور على جهاز حتمي مكتمل سلفاً. وهو مفيد لأن المعلومات المختارة، والفعل المعتمد على القاعدة، وتغيّر العالم ذي السلطة، والنتيجة يمكن فحصها منفصلة.
اكتمل الجهاز قبل تلقّي هذا البحث. يقرأ هذا التقرير مصدره، والسجلات المقبولة، وسبع حلقات محفوظة، وجدول القرارات المشتق. ويضيف تدقيق مصدر/سجل وأشكالاً مشتقة من تلك البيانات المحفوظة. وهو لا ينفّذ العالم، ولا اختبار Go أو مدقّقاً، ولا نموذجاً حياً، ولا تجربة عتاد. قدّمت أربع مذكرات بحث خارجية أسئلة ومصادر مرشّحة؛ وإجاباتها ليست شواهد تجريبية. يميّز جدول الدعاوى/المصادر المرافق النتائج الأصلية، والملاحظات المحلية، والفرضيات، والخيوط غير المحقَّقة.
يتطلّب «الإخفاق» تعريفاً إجرائياً. محمول المُنتقي هو فعل collect لا يتبعه زيادة مرئية في الاحتياطي، بما في ذلك النقصان. وهو لا يحدّد تفسيراً سببياً خفياً ولا يزعم أن الفعل رُفض. «مؤجّل» يشير إلى عواقب أفعال أسبق تؤثّر في توفّر المورد لاحقاً، وإلى التزام يُقيَّم فقط بعد القرار 15. «طويل الأمد» يدل على هذا الأفق المحدود؛ وليس نشراً غير محدّد. تتبع هذه التعريفات المُنتقي المنفَّذ وعقد الجهاز.
2. الجهاز المكتمل
حوض Sol-III current القائم عالم مؤلَّف بلا أبعاد. يحدّد مصدره احتياطياً ابتدائياً 4، وeffort 1، ومورداً مخزوناً 2، وعائقاً. للاحتياطي وeffort والمخزن سقوف محدودة. يختار المقيم بين inspect وcollect وclear وrest. تغيّر الإزالة حالة العائق وبذلك التقاط المطر لاحقاً. يُظهر الإدراك الحالي الاحتياطي وeffort وقراءة رصد؛ ولا يُظهر مباشرة كل متغيّر عالم. إعلانات المورد ودورة الحياة لا تجعل الاحتياطي الصفري موتاً: يمكن للمقيمين مواصلة الفعل عند الصفر. فالنقطة المقاسة إذاً تموين عند أجل، لا بقاء. هذه أوصاف على مستوى مصدر world.go، وليست دعاوى واقعية بيولوجية.
يربط كل سجل ذاكرة إدراك المقيم الفعلي قبل الفعل، والفعل المختار، والإدراك بعد الفعل المسلَّم بنسب حلقة/تشغيل. لا يُقبل إلا السجلات السابقة الكاملة. يرتّب المُنتقي priority أولاً عمليات collect ذات تغيّر احتياطي مرصود غير موجب، ثم يملأ بالحداثة. يرتّب المقارن بالحداثة وحدها. يعيد كلاهما السجلات المختارة زمنياً، ويتجاوز المرشحين المفرطين، ويحدّ المصفوفة المختارة كلها بسجلّين و8192 بايت. الاختيار لا يحدّث أوزان نموذج. يحتفظ المضيف بالأرشيف الأكبر وشواهد الحذف؛ وميزانية الذاكرة المواجهة للمقيم تسري على التعريض المختار، لا على تخزين الحاسوب الكلي.
يستعمل الذراعان المستجيبان المزوّد المؤلَّف عديم الحالة نفسه. لقاعدته ساعة صريحة: عند القرار 5، المقابل لأحد عشر قراراً متبقياً بما فيها الحالي، يُزيل فقط إذا كان الـeffort المرئي ثلاثة على الأقل واحتوت الذاكرة المختارة جمعاً متوقفاً. يستريح في الفترة الوسطى ويجمع بجهد موجب في القرارات الأربعة الأخيرة. فروع أسبق أخرى تستجيب للذاكرة والإدراك الحالي. لذا لا يطلب التجريب من نموذج أن يكتشف استراتيجية. مصدر المزوّد يجعل التبعية قابلة للفحص.
يجمع ضابطان insensitive عندما يكون الـeffort الحالي موجباً وإلا يستريحان، دون استخدام الذاكرة المختارة. تفحص ثلاثة جداول حرفية مساراً ناجحاً، وذلك المسار مع استبدال إزالة القرار 5 بـrest، وسلوك الراحة كلها. لا يُستوفى الهدف المؤجّل إلا عندما تكون حلقة كاملة صالحة ذات 16 قراراً باحتياطي نهائي خمسة على الأقل. تجاوز الخمسة قبل ذلك لا يكفي.
يعيد المدقّق المسجّل بناء التقابل بين البيانات والسجلات والمحاولات والطلبات والذاكرات المختارة والأفعال والرصد والوقائع النهائية قبل التسجيل. وهو مستقل عن المزوّد؛ ولا يزال المقيم نفسه يستعمل مزوّداً مؤلَّفاً. الالتزام الفائت الصالح متميز عن الشاهد الباطل أو الناقص. يمنع هذا التمييز أن يُنبذ إخفاق الهدف صمتاً كسجل باطل، وأن تُحسب أثرية حسنة التكوين نتيجة ناجحة.
3. النتائج في الشروط المحفوظة
تحوي الشروط المسجّلة السبعة كلاً منها 16 قراراً. صفوف القرارات الـ112 قياسات متداخلة، وليست 112 عيّنة مستقلة. قُرئت القيم التالية من ملخصات تشغيل/تحقق محفوظة وقوبلت بالحالات النهائية المستخرجة المقابلة. هي نتائج وصفية لشروط ثابتة، بلا فترة أو قيمة p قائمة على عيّنة. نتائج محفوظة، استخراج قرارات.
الشرط
الاحتياطي النهائي
الالتزام الختامي
responsive-priority
5
مُستوفى
responsive-recency
0
غير مستوفى
insensitive-priority
0
غير مستوفى
insensitive-recency
0
غير مستوفى
literal-success-priority
5
مُستوفى
literal-no-clear-priority
0
غير مستوفى
literal-all-rest-priority
0
غير مستوفى
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
الشكل 1. مسارات مؤلَّفة قائمة. يختلف الزوج المستجيب عند قرار الإزالة ثم في الاحتياطي. للزوج غير الحسّاس أفعال وحالات متطابقة. يسري الشرط عند القرار 15 فقط؛ احتياطي خمسة عند القرار 0 ليس إتماماً. الخطوط تصل حالات القرار المسجّلة ولا تدل على ملاحظات إضافية.
عند القرار 5 يحتفظ priority بالخبرات [1,4] ويزيل؛ وتحتفظ recency بـ[3,4] وتستريح. تحوي مصفوفتا الذاكرة المختارة 2693 و2692 بايت على التوالي، وأحجام JSON لـPetition الملتقطة 5039 و5038 بايت. فسقوف السعة المتساوية لا تقتضي إذاً أعداد بايت متطابقة ولا تكاليف رموز لنماذج لغوية كبيرة. هذه بايتات، لا قياسات مُقطِّع. يُثبت المصدر والاختيار المحفوظ عنق زجاجة بسجلّين عند هذا الحد؛ ولا يُثبتان عنق زجاجة مُلزِماً بـ8192 بايت.
تنتهي الحلقتان المستجيبتان باحتياطي 5 و0. تعطي مقابلاتهما الحرفية المسارات الاحتياطية نفسها؛ واستبدال الإزالة بـrest يغيّر الحصيلة المؤجّلة في التركيب المؤلَّف. للحلقتين غير الحسّاستين تسلسلات فعل/حالة متطابقة من 16 خطوة رغم ذاكرات مختارة مختلفة. هذا ضابط للقاعدة المحدّدة، لا نتيجة عامة بأن الذاكرة لا يمكن أن تهمّ.
4. ما يحدّده الفرق
أقوى تفسير مدعوم شرطي: تغيير سياسة الاختيار يغيّر المعلومات المقدَّمة إلى هذه القاعدة المستجيبة الثابتة، وفعلها عند القرار 5، والحصيلة اللاحقة المحفوظة. التبعية مهندَسة في القاعدة. ولا يحدّد الناتج تمثيلاً ذاكرياً أسمى بذاته ولا تعلّماً تلقائياً.
تظهر تفصيلة حاسمة في حامل الحداثة المحفوظ. تحوي بايتات الذاكرة المختارة عند القرار 5 الخبرة 3، فعل inspect قراءته البعدية reading: 1، إشارة العائق المرصودة. يحسب المزوّد علماً من مثل هذه الرصدات البعدية، لكن فرع القرارات الأحد عشر المتبقية يفحص stalledCollect بدلاً من ذلك. ولا يستخدم علم العائق ذلك لإطلاق الإزالة عند هذا الحد. وبالتالي لا يمكن وصف ذراع الحداثة الخاسرة بأنها بلا تحذير ذي نفع محتمل. هذه ملاحظة مصدر/سجل مباشرة؛ والقضية بأن سياسة أخرى ستستغل الإشارة تفسير بديل معقول للاختبار، لا تجربة جديدة أُجريت هنا. حامل الحداثة المحفوظ، القاعدة المستجيبة.
للمقارنة غير الحسّاسة أيضاً تصحيح محتفظ به. توقّع ضابط أوّلي حضور/غياب مختلفين لعمليات stalled collect، لكن الذراعين احتفظا بواحد. عني الضابط المصحَّح بخبرات محتفظ بها مختلفة مع مسارات عالم متطابقة. الاحتفاظ بالتوقع الفاشل الأصلي يمنع تحويل قصة ضابط خاطئة إلى نتيجة موجبة. يسجّل سجل الجهاز المقبول ذلك التاريخ.
لا يعزل أي شرط في هذه المجموعة ضرورة التأجيل أو الندرة بتغييرهما. يصف التقرير آلية تعمل بحضورهما. ولا يزعم أن تباين المُنتقي نفسه يعتمد فريداً على أي من السمتين، أو أنه يدوم تحت إخفاقات بالية أو مقدّمات متغيّرة أو سياسات مختلفة أو عوالم غير مفحوصة.
5. التحقق نفسه موضوع شاهد
يشترك تنفيذ المزوّد والإعادة الصارمة في قاعدة مؤلَّفة. يمكن لاتفاقهما أن يُثبت الاتساق بينما يفوته انحراف مشترك عن العقد الموثَّق. قصّرت نسخة خاصة خاطئة محفوظة نافذة الجمع الأخيرة من أربعة قرارات إلى ثلاثة؛ وقبل التحقق الصارم لتلك النسخة الحلقة، بينما أعاد القرار 12 inspect بدلاً من collect المتوقَّع مستقلاً. كانت قاعدة المنتج الأصلية صحيحة. احتياطي الأربعة لسياسة متغيّرة ليس نتيجة سلبية للمُنتقي.
ثم قدّم اختبار إضافي اثني عشر توقعاً حرفياً تغطي القرارات 11 و12 و15، وeffort موجب/صفر، وذاكرة stalled collect فارغة/محتفظاً بها. تسجّل السجلات التاريخية نجاح الضابط غير المعدَّل وفشل ثلاثة متغيرات خاطئة قابلة للترجمة عند التوكيدات المقصودة. في تلقّي هذا البحث طابقت هاشات سجلات التنفيذ الثماني وهاش ملف الاختبار الحالي قيمها المسجّلة، وفُحصت رسائل الاختيار الفاشل ذات الصلة. هذه فحوصات سلامة/قراءة جديدة لشواهد تاريخية، لا اختبارات نُفِّذت للتو. تدقيق القبول، اختبار حرفي، أوامر وسجلات مسجّلة.
طابقت فحوصات البايت الحالية أيضاً ملفات الحلقات المحفوظة الـ140 مع الإيصالات السبعة القائمة، ومدخلات المصدر/الوحدة المؤرشفة الـ95 مع بيان responsive-priority. يدعم هذا سلامة الحزمة المفحوصة. وهو لا يشهد أي ثنائي نُفِّذ أصلاً، ولا يُثبت أن كل مدخل مترجم مؤرشف، ولا يحل محل إعادة إنتاج مستقلة جديدة. يحفظ التقرير حد اكتشاف المصدر الموثَّق: الاستعمال المترجَم يتطلّب استخراج المصدر عند مسار بنائه وبناءً بلا -trimpath. تبقى دعاوى البنية الكاملة واسترداد الانهيار وصحة المستودع كله خارج هذا السجل.
6. شواهد تطوير أسبق منفصلة
تحوي مجموعة بيانات جاهزية الورقة الأقدم ثمانية مسارات مؤلَّفة، و128 لحظة متداخلة، وأربع مقارنات ملامح adaptive/baseline. مقياسها مجموع الاحتياطي المحمول بعد كل ProcessMoment عبر اللحظات 0–15، مقاساً بوحدات احتياطي-لحظة. فروقات adaptive ناقص baseline هي +4 و0 و0 و−1. ليست تدخل priority/recency أعلاه، ولا تشارك طرفه الختامي. تعريفات، أربع مقارنات.
Scroll horizontally to inspect the figure →横向滚动以查看图 →橫向捲動以檢視圖 →横にスクロールして図を見る →가로로 밀어 그림을 보세요 →Desplaza en horizontal para ver la figura →Desplaza en horizontal para ver la figura →Role na horizontal para ver a figura →Faites défiler horizontalement pour inspecter la figure →Horizontal scrollen, um die Abbildung zu prüfen →Прокрутите по горизонтали, чтобы рассмотреть рисунок →مرّر أفقياً لمعاينة الشكل ←
الشكل 2. مقارنات الملفات الثابتة الأربع الأسبق كلها، بمقياسها التراكمي الأصلي. تُحفظ القيم السالبة والصفرية. هذا الشكل سياق تطوير منفصل؛ وليس عيّنة إضافية للشكل 1.
يُفهرس في ذلك التلقّي الأقدم أيضاً تجربتا جدوى تاريخيتان لنموذج محلي وصفّا طوبولوجيا جهاز. لا يمكن إضافة أي منها إلى الشروط الحتمية السبعة لتوسيع عيّنة سلوك. تحتفظ الإعادات والمحاولات وإعادة التسجيل والصفوف المتعددة من مسار واحد بنسبها. لقد فُحصت الملامح الأقدم current وshifted وclustered وsparse ولا تصير حجزاً أعمى بإعادة تسميتها.
7. الموقع في الأدبيات
تجمع أنظمة الذاكرة تدخلات ينبغي تمييزها. يجمع Generative Agents عوامل استرجاع تشمل الحداثة القائمة على الوصول والأهمية والصلة؛ وتستخدم استئصالات المقابلة تواريخ راكمتها البنية كاملة. يدفع ذلك التقييم إلى فصل مسابر قرار التاريخ المشترك عن تدخلات المسار الكامل. وهو لا يصدّق نتيجة هذا الحوض. Park et al., 2023, §§4.1 and 6.1–6.2.
يغيّر Reflexion السياق اللاحق بتغذية راجعة نصية دون تغيير أوزان النموذج الأساس. ويورد ملحق WebShop أيضاً وضعاً لم تتحقق فيه التحسين المحاولة. الآلية وذلك الحد يعارضان معاملة الذاكرة أو التأمل كمنفعة غير مشروطة. وهما يعنيان مهاماً وبُنى تجارب تختلف عن هذا الجهاز. Shinn et al., 2023, abstract and Appendix B.1.
لدراسة تجريبية لاحقة يجب أن يتبع حجم العيّنة هدفاً استدلالياً وافتراضات مبرَّرة. فالتخطيط القائم على الدقة مثلاً يتطلّب عرض فترة مستهدفة وحساباً للتباين؛ ولا تقدّم أي ورقة عدداً كافياً عاماً لتشغيلات ORIGIN. Lakens, 2022, “Planning for Precision”.
إتاحة/وظيفية الأثر والنتائج المستقلة إنجازان منفصلان في اصطلاح آثار ACM. يقدّم هذا التقرير تدقيق سلامة محلياً واشتقاق أشكال قابل للإعادة؛ ولا يدّعي شارة مراجعة ولا تكراراً تجريبياً مستقلاً. ACM SIGIR artifact criteria.
يقيّم LongMemEval استراتيجيات القراءة بشواهد مسترجَعة بوحي، مبيناً أن تصميم القارئ يؤثّر في أداء الأسئلة حتى عند تقديم جلسات الشاهد. يعزّز ذلك التمييز بين الاسترجاع والاستخدام ضمن مهمة أسئلة بتاريخ محادثة. وهو لا يقيس الفعل في عالم دائم. Wu et al., v2, §5.5.
يربط XENON ذاكرة الخبرة بتصحيح التبعية وتصحيح الفعل المرشّح. فهو إذاً مرجع لتدخل يختلف عن تغيير تعريض الحلقة مع تثبيت مختار هذا الجهاز. Lee et al., v3, §§4.1–4.2.
يفصل Vending-Bench حدود السياق الحديث عن أدوات الذاكرة الخارجية بلا قيود تخزين صريحة. وتورد إزالته الأصلية لسعة سياق GPT-4o-mini حصائل أسوأ عند حدود أكبر. يحذّر هذا من معاملة كل طبقة ذاكرة كميزانية واحدة أو افتراض منفعة رتيبة؛ ومجاله التجاري ونماذجه التاريخية ليست نتائج ORIGIN. Backlund and Petersson, v1, §§2.1 and 3.5.2.
يعني تحليل التعلّم المعزّز قليل التشغيل لأغاروال وزملائه بالتباين عبر تشغيلات تدريب/تقييم عشوائية. تتطلّب توصياته الإحصائية بنية عيّنة مناسبة ولا تقدّم فترات ثقة لهذه الشروط المؤلَّفة السبعة. Agarwal et al., NeurIPS 2021.
تبقى نتائج بشرية/غير بشرية وحاسوبية/كمية مدخلات محفظة منفصلة، لا شواهد للنتيجة الحالية. يسجّل فصل المصادر النطاق المقبول وتصحيحات لملخصات جمع أضيق مما ينبغي أو ناقصة.
8. استمرار قابل للتكذيب
يمكن لسؤال تجريبي تالٍ أن يسأل ما إذا كان تباين المُنتقي يغيّر احتمال هدف الحلقة الكاملة لتوزيع معلَن للنموذج/المهمة. يجب أن يبقى الاتجاه مفتوحاً. نتيجة سالبة مفيدة تحتفظ بسجل إخفاق ذي صلة دون تحسين الفعل المختار أو الحصيلة الختامية؛ والنتيجة الضارة أيضاً مُعلِمة. يدفع فحص المصدر الحالي أيضاً إلى تمييز الاحتفاظ عن عقد استخدام الإشارة في قاعدة القرار.
قبل أي جمع، حدّد الرصدات المؤهّلة، والتخزين القابل للنفاذ والتعريض لكل قرار، وقواعد المُنتقي/التعادل/الفيض، والمطالبات المسلَّمة، والنموذج والإصدار المطلوب/المبلّغ، وحدود المورد، وتوزيع العالم/الحالة الابتدائية، والحجز المحمي، والأجل، وتوقعات المسجّل المستقل، ونسب الإخفاق/إعادة المحاولة، وقاعدة التوقّف، والتحليل الأوّلي. طابِق سقوف المورد المسموحة مع الإبلاغ عن الاستهلاك الفعلي. لا تُجبر مسارات العالم/الرصد بعد التدخل على البقاء متساوية؛ فقد تحمل تلك الفروق الأثر المدروس.
استخدم حلقات كاملة وحداتٍ، مع كتل أو أزواج مهام معلَنة. العوالم المشتركة ذات المقيمين المتفاعلين تتطلّب وحدات جماعة/عالم. صرّح بمقام كل الحلقات المطلقة ومعاملة الحصائل غير المتاحة قبل النظر في النتائج. لا تضمن بذرة مشتركة عشوائية نموذج مقابلة بعد تفرّق المسارات. اختر أثراً ذا معنى أو هدفاً للدقة وقيّم حساسية حجم العيّنة تحت افتراضات يمكن الدفاع عنها؛ تبقى هذه الكميات غير مضبوطة هنا. هذه دراسة مقترحة، لا تسجيلاً مسبقاً ولا نتيجة تجريبية مكتملة.
9. إعادة الإنتاج والإتاحة
يبقى المصدر الأساسي وسجلات التشغيل خاصة. تحفظ طبعة القراءة هذه الدعاوى العلمية والقيم المسجّلة للمسودة المراجعة داخلياً. تشير إحالات المصدر والتدقيق المحلية في النص إلى سجلات في تلك الحزمة الخاصة؛ وليست روابط أثر علنية.
أُعيد رسم الشكلين SVG من قيم الاستخراج والمقارنة المقبولة لهذا الموقع. قيم الأشكال متاحة لمعاينة النقاط المرسومة. إعادة بناء شكل تختلف عن إعادة تشغيل العالم. لا تحل هذه القيم المشتقة محل المصدر الأساسي وسجلات الحلقات والمسجّل المستقل.
ما يزال الإصدار البحثي العلني يتطلّب تأليفاً مسؤولاً، وحزمة مصدر/بيانات وتنقيح مجمّدة، وروابط أثر مستقرة، ومراجعة لتلك الحزمة. لم تُعيَّن ولم تُصدَر هنا. تغطي المراجعة الداخلية المكتملة المخطوطة التقنية وأشكالها؛ وليست تحكيماً دورياً ولا تنفيذاً مستقلاً للجهاز. تبقى التصحيحات جزءاً من سجل البحث.
سجل المراجعات
9 أيلول/سبتمبر 2026. طبعة قراءة للموقع من المسودة التقنية المراجعة داخلياً. تُحفظ الدعاوى العلمية والقيم المسجّلة. تُحذف روابط نظام الملفات المحلي؛ ويُعاد رسم الشكلين من القيم المسجّلة نفسها لسطح قراءة داكن. يبقى المصدر وسجلات التشغيل خاصة. هذا ليس إصداراً علنياً للآثار ولا تحكيماً دورياً. تتضمّن واجهات اللغات ترجمة كاملة لطبعة القراءة هذه؛ ويبقى النص الإنجليزي الأصل.