Codex 使用指南

搜索全站

输入关键词开始搜索。

页面更新:事实核验:

场景手册

学术 flow

学术任务最容易犯的错是先写论文、后找证据。正确顺序是:研究 brief、文献和新颖性、实验计划、可复现实验、自动审稿、最后才写作。

流水线

从 idea 到可审查证据

学术自动化要保护 claim 边界:没有实验或引用支撑的说法不能进入论文。

Research brief

写清研究问题、目标会议、数据、baseline、预算、预期贡献、不能 claim 什么。

Closest work

先找最接近工作,不是先找支持自己的论文。明确差异点和可能被 reviewer 攻击的地方。

Novelty gate

如果贡献只是已有方法换场景,要降级目标;如果缺少可证伪实验,要先补实验设计。

Experiment plan

定义数据集、baseline、metric、预算、失败标准、日志路径和复现实验命令。

Auto review

让 Codex 以 reviewer 角度检查 novelty、evidence、ablation、claim、writing risk。

Writing boundary

只写已经有证据支撑的结论。负结果和失败实验也要记录,避免 narrative 失真。

产物

每个阶段应该产出什么

学术 flow 更看重落盘产物,而不是聊天记录。没有这些产物,后续写作和审稿都无法追溯。

RESEARCH_BRIEF.md

研究问题、目标 venue、假设、数据、baseline、预算、人工 checkpoint。

IDEA_REPORT.md

问题重要性、closest work、差异、风险、可证伪实验。

实验日志

命令、配置、commit、GPU、数据版本、失败原因、结果表。

AUTO_REVIEW.md

以严格 reviewer 视角列 novelty、实验、写作和 claim 缺口。

图表索引

每个图表对应数据来源、脚本、日志和可复现路径。

Claim ledger

每个论文 claim 对应引用或实验;没有证据的 claim 要删除或降级。

提示词(Prompts)

可复制学术提示词

第一次使用时先保守一些:不要自动推进实验或写论文,先让 Codex 建 brief,划清审查边界。

启动 research-pipeline

$research-pipeline
方向:长上下文 LLM 推理中的 KV cache pruning。

请先创建 RESEARCH_BRIEF.md,并等待我确认。
AUTO_PROCEED: false
HUMAN_CHECKPOINT: true
REVIEWER_DIFFICULTY: hard
AUTO_WRITE: false

预算:
- 最多 20 GPU-hours
- 不允许下载未知大数据集

输出:
- closest work 表
- 可证伪实验计划
- claim 边界

严格审稿

请以强 reviewer 视角审查当前 idea。

重点:
- 最近似工作是什么?
- 贡献是否只是组合或换场景?
- 哪个实验能证伪核心 claim?
- baseline 是否公平?
- 有哪些不能写进论文的说法?

输出:
- reject reasons
- must-have experiments
- claim boundary
- next action

门禁

进入和退出条件

学术自动化要设置 gate;否则一个薄弱的 idea 也可能被包装成看似完整的论文。

进入条件

已经能说清研究问题、目标读者、数据来源、baseline、预算和失败标准。不满足时先做 idea grilling。

推进条件

closest work 已查,核心差异明确,有至少一个能证伪的实验,预算可承受。

退出条件

claim 都能对应实验或引用;负结果被记录;不能证明的说法被删掉或降级。

Stop conditions

  • 新颖性不足closest work 已经覆盖核心贡献。
  • baseline 不可复现无法建立公平比较。
  • 预算不足实验无法在给定 GPU/时间内完成。

写作前检查

  • 每个 claim 有证据引用、实验、图表或日志路径。
  • 图表可复现脚本和数据版本可追溯。
  • 负结果可解释不要删除失败实验的痕迹。

真实实例

真实实例:长上下文 KV cache pruning idea

演示场景

与其直接说“帮我写篇论文”,不如先让 Codex 建立研究 brief,划清审稿边界。例如研究长上下文 LLM 推理中的 KV cache pruning,可以先查 closest work,制定小规模实验计划,确认新颖性和 baseline 后再进入实验。

输入

坏输入是“帮我写论文”;修复后给方向、数据、baseline、预算、不能 claim 的边界。

先读

已有实验、相关论文、数据说明、目标会议标准和本机 research skill 说明。

应动文件

RESEARCH_BRIEF.md、closest work 表、实验计划;未确认前不写论文正文。

验证

claim 是否有引用或实验支撑,baseline 是否明确,预算是否可执行。

最终回答

给出证据边界、下一步实验、不可声称内容和需要人工确认的问题。

失败停止

closest work 不清、实验不可复现、数据不可得或 claim 超出证据时停止。