# v14.d SWE-bench Verified 1–500 最终结果

日期：2026-08-30。评测使用 Qwen3.5-4B SWE SFT v14.d，并在 chat template 中保留所有历史 assistant turn 的 CoT。正式判定采用有效的 SWE-bench F2P 与适用的 P2P 测试。

## 口径与限制

- 严格 pass@1：`submitted=true`，且 F2P 通过、适用的 P2P 通过。
- Patch pass：F2P/P2P 通过，不要求模型执行 submit。
- Turn：每条轨迹全部 assistant messages，包括格式错误的 action response。
- Context：每条轨迹实际已发送请求中的最大 `usage.prompt_tokens`；不包含该请求新生成的 response，也不包含随后尚未再次发送的 observation。
- 分位数：排序后取 `round((n-1)×q)` 对应观测值，不插值。
- 500题均有唯一 rollout 和有效 verification，无 rollout infra error 或 invalid verification。

需要特别说明：这是最终选定的500条轨迹，但不是一次统一配置、统一从零采样的500题实验。issues 1–200 中85题复用150 turns/131,072 context轨迹，115题因原先触顶或未完成而以250 turns/262,144 context选择性重跑；issues 201–500统一使用250 turns/262,144 context。因此34.2%是项目最终合并得分，选择性重采样使其不等同于严格无偏的一次性 pass@1。

## 通过率与提交

| 指标 | 数量 | 比例 |
|---|---:|---:|
| 严格 pass@1（submitted＋F2P/P2P） | 171/500 | **34.2%** |
| Patch pass（不要求 submitted） | 194/500 | **38.8%** |
| F2P pass | 216/500 | 43.2% |
| Submitted | 268/500 | **53.6%** |
| Submitted 条件下严格通过 | 171/268 | 63.8% |
| Patch pass 但未 submitted | 23/500 | 4.6% |
| F2P 通过后发生 P2P regression | 22/500 | 4.4% |
| Turn cap | 203/500 | 40.6% |
| Context cap | 29/500 | 5.8% |
| 任一 cap | 232/500 | 46.4% |

严格 pass@1 的 Wilson 95%区间为30.2%–38.5%；这只描述500题有限样本的不确定性，不消除上述选择性重跑偏差。

另有31题被 Git 历史访问启发式规则标记；若将所有标记保守扣分，严格通过为160/500=32.0%。标记本身不等于确认答案泄漏，因此不作为主分数。

## Turn 与 context 分布

| 指标 | 均值 | P10 | P25 | P50 | P75 | P90 | P95 | P99 | 最大 |
|---|---:|---:|---:|---:|---:|---:|---:|---:|---:|
| Assistant turns/issue | 138.3 | 31 | 48 | **85** | 250 | 250 | 250 | 250 | 250 |
| 最大 prompt context tokens | 77,237 | 16,533 | 24,824 | **46,215** | 116,432 | 198,959 | 250,738 | 261,617 | 261,805 |

Turn 分桶：

| 范围 | 题数 | 比例 |
|---|---:|---:|
| ≤32 | 59 | 11.8% |
| 33–64 | 142 | 28.4% |
| 65–100 | 64 | 12.8% |
| 101–150 | 16 | 3.2% |
| 151–200 | 5 | 1.0% |
| 201–249 | 11 | 2.2% |
| 250（turn cap） | 203 | 40.6% |

Context 分桶：

| 最大 prompt tokens | 题数 | 比例 | 累计比例 |
|---|---:|---:|---:|
| ≤32K | 200 | 40.0% | 40.0% |
| 32K–64K | 106 | 21.2% | 61.2% |
| 64K–96K | 49 | 9.8% | 71.0% |
| 96K–128K | 39 | 7.8% | 78.8% |
| 128K–192K | 54 | 10.8% | 89.6% |
| 192K–256K | 52 | 10.4% | 100% |

严格成功轨迹明显更短：171题平均48.2 turns、P50=46、P90=80；context平均25,079、P50=23,897、P90=41,437。203条 turn-cap 轨迹的context平均117,139，说明大量失败不是256K窗口不足，而是持续探索到250轮。

## 每100题结果

| Issues | 严格 pass@1 | Patch pass | Submit | Turn cap | Context cap |
|---|---:|---:|---:|---:|---:|
| 1–100 | 38% | 39% | 63% | 33% | 4% |
| 101–200 | 36% | 43% | 57% | 43% | 0% |
| 201–300 | 37% | 42% | 47% | 45% | 8% |
| 301–400 | 30% | 35% | 52% | 39% | 9% |
| 401–500 | 30% | 35% | 49% | 43% | 8% |

301–500 的独立结果为60/200=30.0%严格通过、70/200=35.0% patch pass、101/200=50.5% submit。其配置统一，未包含1–200式的选择性重跑。

完整逐题指标、来源哈希、分桶与分组统计见 `artifacts/v14d_sbv500_final_analysis_20260830/analysis.json`。
