Benchmark v2 · catalog 层 · 更新于 2026-10-10 08:04 UTC

理论能否预言 catalog 里每个源的 DET_ML?

这一页用图解释 v2 在比什么、怎么打分、现在的结果,以及从 v1 到 v2 改进了什么。只看结论的话,读下面的方框。

一句话结论。不用任何在 catalog 上拟合的参数,只靠物理推导(单图像理论 + 多相机联合拟合的位置共享损失), DR14 M2 波段 4 点源在检测阈值附近(DET_ML 6–10)的 ΔC 均值偏差从 v1 基线的 0.69σ 降到 0.38σ; 只看理论适用的孤立点源,则为 0.30σ(v1 基线在孤立点源上是 0.60σ)。

剩下的 0.3σ 已经部分找到原因(背景估计误差使宽度变宽;MOS 有约 2–6% 的比例亏缺),正在研究。 拟合了 6 个参数的 V5c 能做到 0.06σ,但它是"样本内",不能算理论成功——我们的目标是用零参数物理达到它。

第 1 步

这个 benchmark 在测什么

emldetect 给每个源一个检测似然 DET_ML。它和似然比统计量 ΔC 一一对应:DET_ML = −ln Q(3/2, ΔC/2)。 所以"预言 DET_ML"等价于"预言 ΔC 的分布"。

  1. 理论只能用可观测量:拟合计数 Ŝ、背景 b、源的位置(偏轴角),以及一个事先声明的源计数先验 π。 真实流量在 catalog 里不可知,所以不允许用。
  2. 理论给出两样东西:这个源的 ΔC 的预测均值和预测宽度(标准差)。
  3. 把每个源换算成 z:z = (观测 ΔC − 预测均值) / 预测宽度。理论正确时,所有源的 z 应服从标准正态分布 N(0,1)。
  4. 按可观测量分箱检查:偏轴环 × 背景切片 × Ŝ,每箱至少 200 个源。绝不按 DET_ML 本身切样本(那会人为制造偏差)。 重点看典型 DET_ML 在 6–10 的分箱,也就是检测阈值附近;这里的误差直接影响 catalog 的完备度和通量偏差修正。
z 分布示意
图 1 示意:理论对时,z 是标准正态(左)。均值算错,整个分布平移(中),这就是 A1 测的;宽度算错,分布变宽或变窄(右),这就是 A2 测的。

第 2 步

怎么打分:三个误差分数 + 参数个数

噪声校正。即使理论完美,有限样本也会让 A1、A2 有一个"噪声底"。表中给的是扣掉噪声底后的值 √(原始² − 噪声底²)。比较两个模型时,用"两级自助法"(先按观测重采样,再在观测内重采样)给出 95% 区间;差别落在区间内就算打平。

前沿(Pareto)。如果模型甲在 A1、A2、A3 上都不比乙差,并且至少一项更好,就说甲"支配"乙。没有被支配的模型组成前沿。 在噪声内打平时,参数少的优先。

样本内 vs 样本外。在 catalog 上拟合过参数的模型(如 V5c,6 个参数)分数天然好看,单独成一个"样本内"前沿。 论文的 catalog 结论必须来自"样本外"模型,也就是参数没碰过这批数据的模型。另外,三分之一的位置被预先留出不公开,只在里程碑时打开,用来检验是否过拟合。

第 3 步

现在的结果

两个 catalog 层:C-all 是 v1 用的全部 DR14 M2 波段 4 点源;C-iso 只保留孤立点源(2′ 内没有展源,最近邻 ≥ 60″)。 理论描述的是孤立点源,所以 C-iso 是检验理论的主要层。我们发现最内环(0–4′)的大部分亏缺来自拥挤或展源邻居,不是理论的问题。

Pareto 图
图 2 每个点是一个模型(越靠左下越好)。绿色是样本外前沿:两个零参数模型,一个均值稍好(T3),一个宽度更好(T3 + E147)。 红色空心方块是样本内的 V5c,它拟合了 6 个参数,所以不和样本外模型直接比。误差棒是两级自助 95% 区间(原始分数的区间宽度)。
改进进度
图 3 A1 均值偏差的变化。第二根柱子是关键的物理改进:catalog 的 DET_ML 来自 15 幅图像(3 相机 × 5 波段)的联合拟合, 源位置是共享的,所以每个波段的 ΔC 会损失一部分位置信息,损失约为 (1−w),w 是这个波段在位置信息中的占比。这一项是推导出来的,没有拟合任何数,却把均值偏差减了一半。 第三根柱子是只看孤立源后的结果。最后一根是拟合了 6 个参数的 V5c,作为"还差多远"的参考。
层模型参数A1 均值A2 宽度A3 过阈值窗口源数
C-isoT3 联合拟合(零参数) 样本外前沿单图像理论 + 联合拟合损失 (1−w) + c20 宽度律。没有任何在 catalog 上拟合的数。00.2960.1070.07818,771
C-isoV4c + 联合拟合损失 在 V4c 上加入多相机联合拟合的位置共享损失 (1−w)。20.3010.1260.07918,771
C-isoT3 + E147 宽度(零参数) 样本外前沿同 T3,但宽度用 E147 混合律。没有任何在 catalog 上拟合的数。00.3150.0770.08418,771
C-iso联合损失 ×0.7 联合拟合损失乘 0.7 的变体(1 个参数)。10.3810.1070.10018,771
C-isoV4c(v1 基线) v1 留下的单图像理论:均值 μ+δ,宽度 V4c 律。2 个早期参数。20.5970.1260.15218,771
C-isoV5c η(样本内,6 参数) 样本内在 catalog 行上拟合了 6 个修正数(η 层)。分数好看,但属于样本内,不能当作理论成功。60.1250.0490.03518,771
C-allT3 联合拟合(零参数) 样本外前沿单图像理论 + 联合拟合损失 (1−w) + c20 宽度律。没有任何在 catalog 上拟合的数。00.3750.1720.09533,683
C-allT3 + E147 宽度(零参数) 样本外前沿同 T3,但宽度用 E147 混合律。没有任何在 catalog 上拟合的数。00.3780.1440.09733,683
C-allV4c + 联合拟合损失 在 V4c 上加入多相机联合拟合的位置共享损失 (1−w)。20.3820.1900.09533,683
C-all联合损失 ×0.7 联合拟合损失乘 0.7 的变体(1 个参数)。10.4650.1710.11733,683
C-allV4c(v1 基线) v1 留下的单图像理论:均值 μ+δ,宽度 V4c 律。2 个早期参数。20.6910.1900.16933,683
C-allV5c η(样本内,6 参数) 样本内在 catalog 行上拟合了 6 个修正数(η 层)。分数好看,但属于样本内,不能当作理论成功。60.0630.0430.01833,683

数值都是噪声校正后的点值,只用公开位置。带区间的完整英文表见 v2 详细表。

第 4 步

改进具体体现在哪里:逐分箱看

下面两张图打开了 A1 和 A3 这两个汇总数,直接看每个分箱。数据是 C-iso 的 M2 波段 4 开发数据,即 T11 第 3 阶段的分箱表。

逐分箱 z 均值和标准差
图 4 左:灰点是 v1 基线,所有分箱都在 −0.45 到 −0.7 之间,说明它系统地高估了 ΔC。 绿点是加入联合拟合损失后的零参数模型,整体上移到 −0.1 到 −0.45,但还没到 0。剩下的这部分就是正在研究的残差。 右:两种模型的宽度差不多,都略大于 1,也就是观测比预测稍微分散。点的大小表示分箱里的源数。
过阈值概率
图 5 每个分箱里,理论预测"DET_ML ≥ 6"的概率(横轴)对比实际观测到的比例(纵轴)。灰点(v1 基线)系统地落在对角线下方, 即高估了过阈值概率;绿点更贴近对角线。对 catalog 用户来说,这就是完备度估计更准。

第 5 步

从 v1 到 v2 改了什么、为什么改

问题v1 的做法v2 的做法为什么
源计数先验没有声明,隐含在模拟设计里(约 α≈1)明确声明先验 π,在 α = 0…2.5 与天空先验下都评分我们证明了 ΔC 的条件均值依赖先验,宽度不依赖;不声明先验,"均值误差"就说不清。
噪声直接比原始分数扣除噪声底,并用区间判定打平v1 有几组排名其实落在噪声里。
重采样单元按分箱两级:先按位置或观测,再在其内部同一幅图像或同一次观测里的源不独立;位置之间也不可互换(位置差异约为图像噪声的 4 倍)。
过阈值概率不评新增 A3catalog 用户关心的是"能不能过阈值"。
过拟合全部数据公开三分之一位置预先留出防止针对公开数据调参。
参数不分样本内外参数计数;样本内与样本外分开成前沿在 catalog 上拟合过的模型不能证明理论正确。
catalog 人群全部点源另设孤立点源层 C-iso理论描述孤立点源;拥挤环境会额外压低 ΔC。
模拟检验只有 emldetect 模拟新增 L0(理想拟合器)、L1(emldetect 对理想拟合器)、J(多相机联合)把"理论对不对"和"emldetect 的工程细节"分开。L1 已证明 emldetect 走的是局部最优,v2 据此改为以局部最优计分。

第 6 步

到目前为止学到的物理

接下来

还没上线的部分