研究报告 · 总览与评测协议¶
本章集中定义训练语料、评测集、评测协议、指标与术语。后续各功能章 (正向 / 逆向 / 多步规划 / 合理性 / SynScore)在此基础上只写各自的模型、 伪代码与结果,不再重复定义口径。
1. 训练语料与反应模板¶
所有单步模型均训练于一份大规模原子映射反应语料(atom-mapped commercial reaction corpus)。原始反应不随软件分发,对外发布的只是训练好的权重。
反应模板以 radius 0 抽取(RDChiral),保留在语料中出现至少 20 次的模板, 得到 64,366 个模板类,作为单步模型的分类标签空间。这套模板库同时服务于逆合成、 正向预测与合理性负样本生成,三者共享。
模板频次呈极端长尾:
| 统计量 | 每模板反应数 |
|---|---|
| 最小 / 中位 / 均值 / 最大 | 20 / 37 / 245.6 / 473,296 |
| 覆盖 50% 反应所需模板数 | 185(0.3%) |
| 覆盖 90% 反应所需模板数 | 17,415(27.1%) |
其中 42,028 个(65.3%) 模板是"简化型"(逆写下产物为单分子、反应物为两个及以上 分子),这一子集是逆向章简化约束模型的动作空间。
数据划分口径
不同模型采用的 train/val/test 切分不同(例如正向模型按反应 id %20 切分,逆合成
原始模型采用另一套按模板最小样本数的分层切分)。各模型的切分数字写在各自章节并标注
来源,本总览不统一给一个数字,以免口径漂移。
2. 评测集¶
| 评测集 | 用途 | 口径 |
|---|---|---|
| ZINC 可购砌块集 | 库存(in-stock)判定 + 结构类基线打分样本 | 判购按 InChIKey;基线打分随机抽 20,000 分子 |
| 1000 ChEMBL 靶集 | 多步规划、SynScore、合理性过滤的统一评测靶 | ChEMBL 35,small molecule,重原子 5–60;固定随机种子抽样、去盐取最大有机组分、按 InChIKey 去重,共抽 1,017、17 个超限、留 1,000 |
1000 ChEMBL 靶集与训练语料相互独立(分布外评测)。其物化描述符分布(中位 [5th, 95th]):
| 描述符 | 中位 [5th, 95th] |
|---|---|
| 重原子数 | 27 [16, 43] |
| 分子量 (Da) | 388 [240, 616] |
| 环数 / 芳环数 | 3 [1, 6] / 2 [0, 4] |
| 可旋转键 | 5 [1, 12] |
| 氢键给体 / 受体 | 1 [0, 4] / 5 [2, 9] |
| TPSA (Ų) | 76 [28, 156] |
| sp³ 碳占比 | 0.31 [0.05, 0.73] |
3. 多步搜索预算(统一操作点)¶
多步规划与 SynScore 评测在预算对齐下进行:
- 扩展宽度 k = 10(每个分子节点取单步模型 top-10 候选反应物集)
- 深度 ≤ 5、节点扩展 ≤ 100、单分子搜索时限 8 s、硬上限 60 s
4. 指标定义¶
| 指标 | 定义 |
|---|---|
| template top-k | 单步模型预测的模板 top-k 中含真实模板的比例 |
| product top-1(正向) | 正向 top-1 产物 canonical SMILES 命中真实产物的比例 |
| solved rate | 在深度 ≤5 内找到一条全部叶子可购(U=0)的路径的靶点比例 |
| U | 最优路径中不可购起始物的数量(越小越好) |
| SynScore | \( \mathrm{SynScore} = 1/(U+1)^{U} \),见 SynScore 章 |
| bb_coverage | 最优路径中可购叶子的比例(连续覆盖度,\([0,1]\)) |
| mean/median expansions | 每靶点平均 / 中位节点扩展数(搜索代价,越小越好) |
| score fidelity r | 某设置下 SynScore 与参考设置(原始模型 @ k=50)的 Pearson 相关 |
| val AUC(合理性) | 反应合理性二分类在验证集上的 ROC AUC |
5. 术语与书写约定¶
- 术语首次出现给中文并括注英文;类名、CLI 子命令、超参名(如
TemplateGNN、predict、hidden_dim)一律保留英文原样。 - 逆合成模板写作
product >> reactants(RDChiral 风格),正向应用时反转为reactants >> product。 - 分子身份:全流程 InChIKey。
| 缩写 | 含义 |
|---|---|
| D-MPNN | 有向键消息传递网络(directed message-passing neural network) |
| AND-OR 图 | 分子节点为 OR、反应节点为 AND 的搜索图 |
| Retro* | Chen et al. (ICML 2020) 的检索式 AND-OR 搜索算法 |
| CGR | 反应缩合图(Condensed Graph of Reaction) |
| bb | building block,可购砌块 |
6. 各章速览¶
| 章节 | 内核 | 关键结果(详见各章) |
|---|---|---|
| 单步正向预测 | D-MPNN 模板分类镜像 + RDKit 正向应用 | 验证集模板 top-1 0.759、产物 top-1 0.636 |
| 单步逆向预测 | D-MPNN 模板分类器(+简化约束变体) | 原始模型 test top-1 0.403 / top-10 0.742;简化模型 held-out top-1 0.575 |
| 多步路径规划 | Retro*(默认)/ MCTS / best-first | 1000 ChEMBL solved 85.1%(简化)/ 81.8%(原始),约 AiZynthFinder 的 1.8× |
| 反应合理性评分 | 双塔 D-MPNN(无映射) | val AUC 0.9946;单步过滤净负收益 → 默认关闭 |
| 可合成性评分 | 基于最优路径不可购起始物数 | SynScore \(=1/(U+1)^U\),连续、可排序 |