{
  "schema_version": "1.0",
  "published_at": "2026-08-28",
  "evidence_policy": "Quantitative claims are sourced from supplied artifacts or linked public samples.",
  "families": [
    {
      "slug": "gdpval-aa",
      "name": "GDPval-AA v2-shaped professional work",
      "evidence_status": "supplied_blind_runs",
      "runs": [
        {"suite": "Ulam GDPval Harbor Synth v0.1.0", "model": "GPT-5.6 Sol Pro", "tasks": 44, "mean_reward": 0.909732},
        {"suite": "Ulam GDPval Harbor Synth v2.0.0", "model": "GPT-5.6 Sol Pro", "tasks": 44, "mean_reward": 0.904354},
        {"suite": "Ulam GDPval Harbor Synth v3.0.0", "model": "GPT-5.6 Sol Pro", "tasks": 44, "mean_reward": 0.830111}
      ]
    },
    {
      "slug": "terminal-bench",
      "name": "Terminal-Bench v2.1-shaped RL environments",
      "evidence_status": "supplied_blind_runs",
      "runs": [
        {"suite": "Terminal hard sample 1", "model": "GPT-5.6 Sol Pro", "tasks": 5, "mean_reward": 0.843636},
        {"suite": "Terminal hard sample 2", "model": "GPT-5.6 Sol Pro", "tasks": 5, "mean_reward": 0.94}
      ]
    },
    {
      "slug": "humanitys-last-exam",
      "name": "Humanity's Last Exam-shaped reasoning environments",
      "evidence_status": "supplied_blind_run",
      "runs": [{"suite": "Ulam HLE Harbor Synth v1 evaluation", "model": "GPT-5.6 Sol Pro", "tasks": 50, "strict_accuracy": 0.96, "mean_reward": 0.919878633}]
    },
    {
      "slug": "gpqa-diamond",
      "name": "GPQA Diamond-shaped science environments",
      "evidence_status": "supplied_blind_run",
      "runs": [{"suite": "Ulam GPQA Synth Harbor v3 evaluation", "model": "GPT-5.6 Sol Pro", "tasks": 33, "exact_accuracy": 1.0, "mean_reward": 0.958581}]
    },
    {
      "slug": "critpt",
      "name": "CritPt-shaped research physics environments",
      "evidence_status": "supplied_blind_run",
      "runs": [{"suite": "CritPt-Synth-Hard-v1 test", "model": "GPT-5.6 Sol Pro", "checkpoints": 36, "exact_solve_rate": 0.833333, "normalized_score": 0.85, "submissions": 71}]
    },
    {
      "slug": "ulam-math",
      "name": "Ulam Math Data",
      "evidence_status": "public_samples_and_internal_program_description",
      "public_samples": [
        "https://huggingface.co/datasets/ulamai/AIME-Plus-Plus",
        "https://huggingface.co/datasets/ulamai/Math-RL-Tasks",
        "https://huggingface.co/datasets/ulamai/SOTA-Math"
      ]
    }
  ]
}
