{
 "experiment_id": "Pillar3_Sovereign_APU_Economics",
 "date_utc": "2026-10-10 23:26:56Z",
 "system_metadata": {
  "architecture": "AMD Strix Halo APU",
  "processor": "AMD Ryzen AI MAX+ 395 w/ Radeon 8060S (40 RDNA 3.5 CUs)",
  "unified_memory_gb": 122.7,
  "memory_bus_type": "LPDDR5X-8000 (256-bit bus)",
  "theoretical_bandwidth_gbps": 256.0,
  "marginal_cloud_cost_usd": 0.0,
  "power_telemetry_source": "/sys/class/hwmon/hwmon5/power1_input",
  "tasmota_telemetry_active": true,
  "tasmota_measured_wall_watts": 61.0,
  "tasmota_measured_voltage": 119.0,
  "tasmota_measured_current_amps": 0.478,
  "tasmota_measured_power_factor": 1.0,
  "idle_power_watts": 61.0,
  "wall_power_factor": 1.182,
  "platform_base_watts": 12.5,
  "electricity_rate_per_kwh": 0.14,
  "timestamp_utc": "2026-10-10 23:25:48Z"
 },
 "quantization_profiles": {
  "9b_q4_k_m": {
   "model_family": "9b_dense",
   "parameters_billion": 9.0,
   "quantization": "Q4_K_M",
   "bits_per_weight": 4.5,
   "weights_memory_gb": 5.8,
   "fits_in_unified_ram": true,
   "description": "9B parameter test-time reasoning model (4-bit quantized)"
  },
  "9b_q8_0": {
   "model_family": "9b_dense",
   "parameters_billion": 9.0,
   "quantization": "Q8_0",
   "bits_per_weight": 8.5,
   "weights_memory_gb": 9.8,
   "fits_in_unified_ram": true,
   "description": "9B parameter test-time reasoning model (8-bit near-lossless)"
  },
  "14b_q4_k_m": {
   "model_family": "14b_dense",
   "parameters_billion": 14.0,
   "quantization": "Q4_K_M",
   "bits_per_weight": 4.5,
   "weights_memory_gb": 9.1,
   "fits_in_unified_ram": true,
   "description": "14B parameter reasoning model (4-bit quantized)"
  },
  "30b_q4_k_m": {
   "model_family": "30b_dense",
   "parameters_billion": 30.0,
   "quantization": "Q4_K_M",
   "bits_per_weight": 4.5,
   "weights_memory_gb": 18.5,
   "fits_in_unified_ram": true,
   "description": "30B parameter reasoning model (4-bit quantized)"
  },
  "35b_q4_k_m": {
   "model_family": "35b_dense",
   "parameters_billion": 35.0,
   "quantization": "Q4_K_M",
   "bits_per_weight": 4.5,
   "weights_memory_gb": 22.8,
   "fits_in_unified_ram": true,
   "description": "35B parameter reasoning model (4-bit quantized)"
  },
  "35b_q8_0": {
   "model_family": "35b_dense",
   "parameters_billion": 35.0,
   "quantization": "Q8_0",
   "bits_per_weight": 8.5,
   "weights_memory_gb": 37.2,
   "fits_in_unified_ram": true,
   "description": "35B parameter reasoning model (8-bit near-lossless)"
  },
  "122b_q4_k_m": {
   "model_family": "122b_dense",
   "parameters_billion": 122.0,
   "quantization": "Q4_K_M",
   "bits_per_weight": 4.5,
   "weights_memory_gb": 81.2,
   "fits_in_unified_ram": true,
   "description": "122B parameter frontier reasoning model (4-bit quantized, fully resident in 122.7GB unified RAM)"
  }
 },
 "live_model_specs": {
  "9.7B dense": {
   "model_name": "9.7B dense",
   "architecture_type": "Dense Autoregressive",
   "parameters_total_billion": 9.7,
   "parameters_active_billion": 9.7,
   "weights_memory_gb": 6.14,
   "quantization": "Q4_K_M",
   "context_length": 40960,
   "description": "9.7B parameter dense reasoning model on Ollama"
  },
  "31.1B mixture (3.0B active)": {
   "model_name": "31.1B mixture (3.0B active)",
   "architecture_type": "Sparse Mixture-of-Experts (MoE)",
   "parameters_total_billion": 31.1,
   "parameters_active_billion": 3.0,
   "weights_memory_gb": 18.25,
   "quantization": "Q4_K_M",
   "context_length": 262144,
   "description": "31.1B parameter sparse MoE model (~3B active parameters per token)"
  },
  "125.1B mixture (22B active)": {
   "model_name": "125.1B mixture (22B active)",
   "architecture_type": "Sparse Mixture-of-Experts (MoE)",
   "parameters_total_billion": 125.1,
   "parameters_active_billion": 22.0,
   "weights_memory_gb": 75.78,
   "quantization": "Q4_K_M",
   "context_length": 262144,
   "description": "125.1B parameter frontier MoE model (~22B active parameters per token)"
  }
 },
 "live_multi_model_sweep": [
  {
   "model_name": "9.7B dense",
   "reasoning_depth": "short",
   "prompt_tokens": 32,
   "reasoning_tokens": 384,
   "duration_sec": 10.47,
   "tokens_per_sec": 36.68,
   "ttft_ms": 88.63,
   "latency_percentiles": {
    "p50_ms": 27.34,
    "p90_ms": 54.49,
    "p95_ms": 54.72,
    "p99_ms": 82.08,
    "mean_ms": 31.92,
    "min_ms": 2.23,
    "max_ms": 82.43,
    "std_ms": 12.58
   },
   "apu_power_mean_watts": 95.6,
   "apu_power_peak_watts": 134.01,
   "wall_power_mean_watts": 139.6,
   "wall_power_peak_watts": 192.0,
   "wall_power_source": "physical_tasmota_v2_plug",
   "tasmota_power_factor": 0.96,
   "tasmota_voltage": 118.3,
   "tasmota_current_amps": 1.14,
   "modeled_wall_power_watts": 125.46,
   "wall_vs_modeled_discrepancy_pct": 11.27,
   "measured_wall_to_apu_ratio": 0.685,
   "total_joules": 2010.98,
   "joules_per_token": 5.2369,
   "joules_per_1k_tokens": 5236.93,
   "cost_per_million_tokens_usd": 0.2037,
   "architecture_type": "Dense Autoregressive",
   "parameters_total_billion": 9.7,
   "parameters_active_billion": 9.7,
   "weights_memory_gb": 6.14,
   "quantization": "Q4_K_M"
  },
  {
   "model_name": "31.1B mixture (3.0B active)",
   "reasoning_depth": "short",
   "prompt_tokens": 32,
   "reasoning_tokens": 384,
   "duration_sec": 5.7,
   "tokens_per_sec": 67.32,
   "ttft_ms": 18.91,
   "latency_percentiles": {
    "p50_ms": 14.91,
    "p90_ms": 29.28,
    "p95_ms": 29.6,
    "p99_ms": 30.38,
    "mean_ms": 16.78,
    "min_ms": 2.18,
    "max_ms": 36.46,
    "std_ms": 5.09
   },
   "apu_power_mean_watts": 117.82,
   "apu_power_peak_watts": 124.01,
   "wall_power_mean_watts": 170.73,
   "wall_power_peak_watts": 185.0,
   "wall_power_source": "physical_tasmota_v2_plug",
   "tasmota_power_factor": 1.0,
   "tasmota_voltage": 118.0,
   "tasmota_current_amps": 1.345,
   "modeled_wall_power_watts": 151.72,
   "wall_vs_modeled_discrepancy_pct": 12.53,
   "measured_wall_to_apu_ratio": 0.69,
   "total_joules": 954.34,
   "joules_per_token": 2.4853,
   "joules_per_1k_tokens": 2485.26,
   "cost_per_million_tokens_usd": 0.0966,
   "architecture_type": "Sparse Mixture-of-Experts (MoE)",
   "parameters_total_billion": 31.1,
   "parameters_active_billion": 3.0,
   "weights_memory_gb": 18.25,
   "quantization": "Q4_K_M"
  },
  {
   "model_name": "125.1B mixture (22B active)",
   "reasoning_depth": "short",
   "prompt_tokens": 32,
   "reasoning_tokens": 384,
   "duration_sec": 14.37,
   "tokens_per_sec": 26.71,
   "ttft_ms": 319.07,
   "latency_percentiles": {
    "p50_ms": 37.06,
    "p90_ms": 74.01,
    "p95_ms": 110.01,
    "p99_ms": 111.08,
    "mean_ms": 48.24,
    "min_ms": 35.93,
    "max_ms": 206.26,
    "std_ms": 23.58
   },
   "apu_power_mean_watts": 52.79,
   "apu_power_peak_watts": 125.09,
   "wall_power_mean_watts": 87.64,
   "wall_power_peak_watts": 181.0,
   "wall_power_source": "physical_tasmota_v2_plug",
   "tasmota_power_factor": 0.88,
   "tasmota_voltage": 119.2,
   "tasmota_current_amps": 0.793,
   "modeled_wall_power_watts": 74.88,
   "wall_vs_modeled_discrepancy_pct": 17.04,
   "measured_wall_to_apu_ratio": 0.602,
   "total_joules": 3950.51,
   "joules_per_token": 10.2878,
   "joules_per_1k_tokens": 10287.79,
   "cost_per_million_tokens_usd": 0.4001,
   "architecture_type": "Sparse Mixture-of-Experts (MoE)",
   "parameters_total_billion": 125.1,
   "parameters_active_billion": 22.0,
   "weights_memory_gb": 75.78,
   "quantization": "Q4_K_M"
  }
 ],
 "benchmarks": [
  {
   "profile_key": "9b_q4_k_m",
   "model_description": "9B parameter test-time reasoning model (4-bit quantized)",
   "parameters_billion": 9.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 5.8,
   "reasoning_depth": "short",
   "prompt_tokens": 32,
   "reasoning_tokens": 384,
   "duration_sec": 10.47,
   "tokens_per_sec": 36.68,
   "ttft_ms": 88.63,
   "latency_percentiles": {
    "p50_ms": 27.34,
    "p90_ms": 54.49,
    "p95_ms": 54.72,
    "p99_ms": 82.08,
    "mean_ms": 31.92,
    "min_ms": 2.23,
    "max_ms": 82.43,
    "std_ms": 12.58
   },
   "apu_power_mean_watts": 95.6,
   "wall_power_mean_watts": 139.6,
   "total_joules": 2010.98,
   "joules_per_token": 5.2369,
   "joules_per_1k_tokens": 5236.93,
   "effective_bandwidth_gbps": 212.74,
   "bandwidth_saturation_pct": 83.1,
   "cost_per_million_tokens_usd": 0.2037,
   "execution_mode": "physical_telemetry_live"
  },
  {
   "profile_key": "9b_q4_k_m",
   "model_description": "9B parameter test-time reasoning model (4-bit quantized)",
   "parameters_billion": 9.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 5.8,
   "reasoning_depth": "standard",
   "prompt_tokens": 45,
   "reasoning_tokens": 1024,
   "duration_sec": 26.66,
   "tokens_per_sec": 38.41,
   "ttft_ms": 96.0,
   "latency_percentiles": {
    "p50_ms": 26.03,
    "p90_ms": 27.33,
    "p95_ms": 29.16,
    "p99_ms": 33.32,
    "mean_ms": 26.55
   },
   "apu_power_mean_watts": 81.18,
   "wall_power_mean_watts": 108.42,
   "total_joules": 2890.26,
   "joules_per_token": 2.8225,
   "joules_per_1k_tokens": 2822.52,
   "effective_bandwidth_gbps": 222.8,
   "bandwidth_saturation_pct": 87.03,
   "cost_per_million_tokens_usd": 0.1098,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "9b_q4_k_m",
   "model_description": "9B parameter test-time reasoning model (4-bit quantized)",
   "parameters_billion": 9.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 5.8,
   "reasoning_depth": "deep",
   "prompt_tokens": 120,
   "reasoning_tokens": 4096,
   "duration_sec": 106.63,
   "tokens_per_sec": 38.41,
   "ttft_ms": 231.0,
   "latency_percentiles": {
    "p50_ms": 26.03,
    "p90_ms": 27.33,
    "p95_ms": 29.16,
    "p99_ms": 33.32,
    "mean_ms": 26.55
   },
   "apu_power_mean_watts": 81.18,
   "wall_power_mean_watts": 108.42,
   "total_joules": 11561.05,
   "joules_per_token": 2.8225,
   "joules_per_1k_tokens": 2822.52,
   "effective_bandwidth_gbps": 222.8,
   "bandwidth_saturation_pct": 87.03,
   "cost_per_million_tokens_usd": 0.1098,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "9b_q8_0",
   "model_description": "9B parameter test-time reasoning model (8-bit near-lossless)",
   "parameters_billion": 9.0,
   "quantization": "Q8_0",
   "weights_memory_gb": 9.8,
   "reasoning_depth": "short",
   "prompt_tokens": 18,
   "reasoning_tokens": 256,
   "duration_sec": 11.26,
   "tokens_per_sec": 22.73,
   "ttft_ms": 47.4,
   "latency_percentiles": {
    "p50_ms": 43.99,
    "p90_ms": 46.18,
    "p95_ms": 49.26,
    "p99_ms": 56.3,
    "mean_ms": 44.87
   },
   "apu_power_mean_watts": 81.18,
   "wall_power_mean_watts": 108.42,
   "total_joules": 1220.89,
   "joules_per_token": 4.7691,
   "joules_per_1k_tokens": 4769.09,
   "effective_bandwidth_gbps": 222.8,
   "bandwidth_saturation_pct": 87.03,
   "cost_per_million_tokens_usd": 0.1855,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "9b_q8_0",
   "model_description": "9B parameter test-time reasoning model (8-bit near-lossless)",
   "parameters_billion": 9.0,
   "quantization": "Q8_0",
   "weights_memory_gb": 9.8,
   "reasoning_depth": "standard",
   "prompt_tokens": 45,
   "reasoning_tokens": 1024,
   "duration_sec": 45.04,
   "tokens_per_sec": 22.73,
   "ttft_ms": 96.0,
   "latency_percentiles": {
    "p50_ms": 43.99,
    "p90_ms": 46.18,
    "p95_ms": 49.26,
    "p99_ms": 56.3,
    "mean_ms": 44.87
   },
   "apu_power_mean_watts": 81.18,
   "wall_power_mean_watts": 108.42,
   "total_joules": 4883.55,
   "joules_per_token": 4.7691,
   "joules_per_1k_tokens": 4769.09,
   "effective_bandwidth_gbps": 222.8,
   "bandwidth_saturation_pct": 87.03,
   "cost_per_million_tokens_usd": 0.1855,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "9b_q8_0",
   "model_description": "9B parameter test-time reasoning model (8-bit near-lossless)",
   "parameters_billion": 9.0,
   "quantization": "Q8_0",
   "weights_memory_gb": 9.8,
   "reasoning_depth": "deep",
   "prompt_tokens": 120,
   "reasoning_tokens": 4096,
   "duration_sec": 180.17,
   "tokens_per_sec": 22.73,
   "ttft_ms": 231.0,
   "latency_percentiles": {
    "p50_ms": 43.99,
    "p90_ms": 46.18,
    "p95_ms": 49.26,
    "p99_ms": 56.3,
    "mean_ms": 44.87
   },
   "apu_power_mean_watts": 81.18,
   "wall_power_mean_watts": 108.42,
   "total_joules": 19534.2,
   "joules_per_token": 4.7691,
   "joules_per_1k_tokens": 4769.09,
   "effective_bandwidth_gbps": 222.8,
   "bandwidth_saturation_pct": 87.03,
   "cost_per_million_tokens_usd": 0.1855,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "14b_q4_k_m",
   "model_description": "14B parameter reasoning model (4-bit quantized)",
   "parameters_billion": 14.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 9.1,
   "reasoning_depth": "short",
   "prompt_tokens": 18,
   "reasoning_tokens": 256,
   "duration_sec": 10.46,
   "tokens_per_sec": 24.48,
   "ttft_ms": 47.4,
   "latency_percentiles": {
    "p50_ms": 40.84,
    "p90_ms": 42.89,
    "p95_ms": 45.75,
    "p99_ms": 52.28,
    "mean_ms": 41.66
   },
   "apu_power_mean_watts": 81.84,
   "wall_power_mean_watts": 109.2,
   "total_joules": 1141.78,
   "joules_per_token": 4.4601,
   "joules_per_1k_tokens": 4460.09,
   "effective_bandwidth_gbps": 222.8,
   "bandwidth_saturation_pct": 87.03,
   "cost_per_million_tokens_usd": 0.1734,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "14b_q4_k_m",
   "model_description": "14B parameter reasoning model (4-bit quantized)",
   "parameters_billion": 14.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 9.1,
   "reasoning_depth": "standard",
   "prompt_tokens": 45,
   "reasoning_tokens": 1024,
   "duration_sec": 41.82,
   "tokens_per_sec": 24.48,
   "ttft_ms": 96.0,
   "latency_percentiles": {
    "p50_ms": 40.84,
    "p90_ms": 42.89,
    "p95_ms": 45.75,
    "p99_ms": 52.28,
    "mean_ms": 41.66
   },
   "apu_power_mean_watts": 81.84,
   "wall_power_mean_watts": 109.2,
   "total_joules": 4567.13,
   "joules_per_token": 4.4601,
   "joules_per_1k_tokens": 4460.09,
   "effective_bandwidth_gbps": 222.8,
   "bandwidth_saturation_pct": 87.03,
   "cost_per_million_tokens_usd": 0.1734,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "14b_q4_k_m",
   "model_description": "14B parameter reasoning model (4-bit quantized)",
   "parameters_billion": 14.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 9.1,
   "reasoning_depth": "deep",
   "prompt_tokens": 120,
   "reasoning_tokens": 4096,
   "duration_sec": 167.3,
   "tokens_per_sec": 24.48,
   "ttft_ms": 231.0,
   "latency_percentiles": {
    "p50_ms": 40.84,
    "p90_ms": 42.89,
    "p95_ms": 45.75,
    "p99_ms": 52.28,
    "mean_ms": 41.66
   },
   "apu_power_mean_watts": 81.84,
   "wall_power_mean_watts": 109.2,
   "total_joules": 18268.52,
   "joules_per_token": 4.4601,
   "joules_per_1k_tokens": 4460.09,
   "effective_bandwidth_gbps": 222.8,
   "bandwidth_saturation_pct": 87.03,
   "cost_per_million_tokens_usd": 0.1734,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "30b_q4_k_m",
   "model_description": "30B parameter reasoning model (4-bit quantized)",
   "parameters_billion": 30.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 18.5,
   "reasoning_depth": "short",
   "prompt_tokens": 18,
   "reasoning_tokens": 256,
   "duration_sec": 21.38,
   "tokens_per_sec": 11.97,
   "ttft_ms": 47.4,
   "latency_percentiles": {
    "p50_ms": 83.52,
    "p90_ms": 87.7,
    "p95_ms": 93.54,
    "p99_ms": 106.91,
    "mean_ms": 85.19
   },
   "apu_power_mean_watts": 83.93,
   "wall_power_mean_watts": 111.68,
   "total_joules": 2387.84,
   "joules_per_token": 9.3275,
   "joules_per_1k_tokens": 9327.52,
   "effective_bandwidth_gbps": 221.5,
   "bandwidth_saturation_pct": 86.52,
   "cost_per_million_tokens_usd": 0.3627,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "30b_q4_k_m",
   "model_description": "30B parameter reasoning model (4-bit quantized)",
   "parameters_billion": 30.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 18.5,
   "reasoning_depth": "standard",
   "prompt_tokens": 45,
   "reasoning_tokens": 1024,
   "duration_sec": 85.53,
   "tokens_per_sec": 11.97,
   "ttft_ms": 96.0,
   "latency_percentiles": {
    "p50_ms": 83.52,
    "p90_ms": 87.7,
    "p95_ms": 93.54,
    "p99_ms": 106.91,
    "mean_ms": 85.19
   },
   "apu_power_mean_watts": 83.93,
   "wall_power_mean_watts": 111.68,
   "total_joules": 9551.38,
   "joules_per_token": 9.3275,
   "joules_per_1k_tokens": 9327.52,
   "effective_bandwidth_gbps": 221.5,
   "bandwidth_saturation_pct": 86.52,
   "cost_per_million_tokens_usd": 0.3627,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "30b_q4_k_m",
   "model_description": "30B parameter reasoning model (4-bit quantized)",
   "parameters_billion": 30.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 18.5,
   "reasoning_depth": "deep",
   "prompt_tokens": 120,
   "reasoning_tokens": 4096,
   "duration_sec": 342.1,
   "tokens_per_sec": 11.97,
   "ttft_ms": 231.0,
   "latency_percentiles": {
    "p50_ms": 83.52,
    "p90_ms": 87.7,
    "p95_ms": 93.54,
    "p99_ms": 106.91,
    "mean_ms": 85.19
   },
   "apu_power_mean_watts": 83.93,
   "wall_power_mean_watts": 111.68,
   "total_joules": 38205.51,
   "joules_per_token": 9.3275,
   "joules_per_1k_tokens": 9327.52,
   "effective_bandwidth_gbps": 221.5,
   "bandwidth_saturation_pct": 86.52,
   "cost_per_million_tokens_usd": 0.3627,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "35b_q4_k_m",
   "model_description": "35B parameter reasoning model (4-bit quantized)",
   "parameters_billion": 35.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 22.8,
   "reasoning_depth": "short",
   "prompt_tokens": 18,
   "reasoning_tokens": 256,
   "duration_sec": 26.35,
   "tokens_per_sec": 9.71,
   "ttft_ms": 47.4,
   "latency_percentiles": {
    "p50_ms": 102.93,
    "p90_ms": 108.08,
    "p95_ms": 115.29,
    "p99_ms": 131.76,
    "mean_ms": 104.99
   },
   "apu_power_mean_watts": 84.59,
   "wall_power_mean_watts": 112.45,
   "total_joules": 2963.27,
   "joules_per_token": 11.5753,
   "joules_per_1k_tokens": 11575.29,
   "effective_bandwidth_gbps": 221.5,
   "bandwidth_saturation_pct": 86.52,
   "cost_per_million_tokens_usd": 0.4502,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "35b_q4_k_m",
   "model_description": "35B parameter reasoning model (4-bit quantized)",
   "parameters_billion": 35.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 22.8,
   "reasoning_depth": "standard",
   "prompt_tokens": 45,
   "reasoning_tokens": 1024,
   "duration_sec": 105.4,
   "tokens_per_sec": 9.71,
   "ttft_ms": 96.0,
   "latency_percentiles": {
    "p50_ms": 102.93,
    "p90_ms": 108.08,
    "p95_ms": 115.29,
    "p99_ms": 131.76,
    "mean_ms": 104.99
   },
   "apu_power_mean_watts": 84.59,
   "wall_power_mean_watts": 112.45,
   "total_joules": 11853.1,
   "joules_per_token": 11.5753,
   "joules_per_1k_tokens": 11575.29,
   "effective_bandwidth_gbps": 221.5,
   "bandwidth_saturation_pct": 86.52,
   "cost_per_million_tokens_usd": 0.4502,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "35b_q4_k_m",
   "model_description": "35B parameter reasoning model (4-bit quantized)",
   "parameters_billion": 35.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 22.8,
   "reasoning_depth": "deep",
   "prompt_tokens": 120,
   "reasoning_tokens": 4096,
   "duration_sec": 421.62,
   "tokens_per_sec": 9.71,
   "ttft_ms": 231.0,
   "latency_percentiles": {
    "p50_ms": 102.93,
    "p90_ms": 108.08,
    "p95_ms": 115.29,
    "p99_ms": 131.76,
    "mean_ms": 104.99
   },
   "apu_power_mean_watts": 84.59,
   "wall_power_mean_watts": 112.45,
   "total_joules": 47412.39,
   "joules_per_token": 11.5753,
   "joules_per_1k_tokens": 11575.29,
   "effective_bandwidth_gbps": 221.5,
   "bandwidth_saturation_pct": 86.52,
   "cost_per_million_tokens_usd": 0.4502,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "35b_q8_0",
   "model_description": "35B parameter reasoning model (8-bit near-lossless)",
   "parameters_billion": 35.0,
   "quantization": "Q8_0",
   "weights_memory_gb": 37.2,
   "reasoning_depth": "short",
   "prompt_tokens": 18,
   "reasoning_tokens": 256,
   "duration_sec": 42.99,
   "tokens_per_sec": 5.95,
   "ttft_ms": 47.4,
   "latency_percentiles": {
    "p50_ms": 167.95,
    "p90_ms": 176.34,
    "p95_ms": 188.1,
    "p99_ms": 214.97,
    "mean_ms": 171.3
   },
   "apu_power_mean_watts": 84.59,
   "wall_power_mean_watts": 112.45,
   "total_joules": 4834.82,
   "joules_per_token": 18.886,
   "joules_per_1k_tokens": 18886.0,
   "effective_bandwidth_gbps": 221.5,
   "bandwidth_saturation_pct": 86.52,
   "cost_per_million_tokens_usd": 0.7345,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "35b_q8_0",
   "model_description": "35B parameter reasoning model (8-bit near-lossless)",
   "parameters_billion": 35.0,
   "quantization": "Q8_0",
   "weights_memory_gb": 37.2,
   "reasoning_depth": "standard",
   "prompt_tokens": 45,
   "reasoning_tokens": 1024,
   "duration_sec": 171.98,
   "tokens_per_sec": 5.95,
   "ttft_ms": 96.0,
   "latency_percentiles": {
    "p50_ms": 167.95,
    "p90_ms": 176.34,
    "p95_ms": 188.1,
    "p99_ms": 214.97,
    "mean_ms": 171.3
   },
   "apu_power_mean_watts": 84.59,
   "wall_power_mean_watts": 112.45,
   "total_joules": 19339.26,
   "joules_per_token": 18.886,
   "joules_per_1k_tokens": 18886.0,
   "effective_bandwidth_gbps": 221.5,
   "bandwidth_saturation_pct": 86.52,
   "cost_per_million_tokens_usd": 0.7345,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "35b_q8_0",
   "model_description": "35B parameter reasoning model (8-bit near-lossless)",
   "parameters_billion": 35.0,
   "quantization": "Q8_0",
   "weights_memory_gb": 37.2,
   "reasoning_depth": "deep",
   "prompt_tokens": 120,
   "reasoning_tokens": 4096,
   "duration_sec": 687.91,
   "tokens_per_sec": 5.95,
   "ttft_ms": 231.0,
   "latency_percentiles": {
    "p50_ms": 167.95,
    "p90_ms": 176.34,
    "p95_ms": 188.1,
    "p99_ms": 214.97,
    "mean_ms": 171.3
   },
   "apu_power_mean_watts": 84.59,
   "wall_power_mean_watts": 112.45,
   "total_joules": 77357.06,
   "joules_per_token": 18.886,
   "joules_per_1k_tokens": 18886.0,
   "effective_bandwidth_gbps": 221.5,
   "bandwidth_saturation_pct": 86.52,
   "cost_per_million_tokens_usd": 0.7345,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "122b_q4_k_m",
   "model_description": "122B parameter frontier reasoning model (4-bit quantized, fully resident in 122.7GB unified RAM)",
   "parameters_billion": 122.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 81.2,
   "reasoning_depth": "short",
   "prompt_tokens": 18,
   "reasoning_tokens": 256,
   "duration_sec": 96.59,
   "tokens_per_sec": 2.65,
   "ttft_ms": 47.4,
   "latency_percentiles": {
    "p50_ms": 377.32,
    "p90_ms": 396.19,
    "p95_ms": 422.6,
    "p99_ms": 482.97,
    "mean_ms": 384.87
   },
   "apu_power_mean_watts": 96.0,
   "wall_power_mean_watts": 125.93,
   "total_joules": 12164.66,
   "joules_per_token": 47.5182,
   "joules_per_1k_tokens": 47518.21,
   "effective_bandwidth_gbps": 215.2,
   "bandwidth_saturation_pct": 84.06,
   "cost_per_million_tokens_usd": 1.8479,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "122b_q4_k_m",
   "model_description": "122B parameter frontier reasoning model (4-bit quantized, fully resident in 122.7GB unified RAM)",
   "parameters_billion": 122.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 81.2,
   "reasoning_depth": "standard",
   "prompt_tokens": 45,
   "reasoning_tokens": 1024,
   "duration_sec": 386.38,
   "tokens_per_sec": 2.65,
   "ttft_ms": 96.0,
   "latency_percentiles": {
    "p50_ms": 377.32,
    "p90_ms": 396.19,
    "p95_ms": 422.6,
    "p99_ms": 482.97,
    "mean_ms": 384.87
   },
   "apu_power_mean_watts": 96.0,
   "wall_power_mean_watts": 125.93,
   "total_joules": 48658.64,
   "joules_per_token": 47.5182,
   "joules_per_1k_tokens": 47518.21,
   "effective_bandwidth_gbps": 215.2,
   "bandwidth_saturation_pct": 84.06,
   "cost_per_million_tokens_usd": 1.8479,
   "execution_mode": "empirical_calibrated_telemetry"
  },
  {
   "profile_key": "122b_q4_k_m",
   "model_description": "122B parameter frontier reasoning model (4-bit quantized, fully resident in 122.7GB unified RAM)",
   "parameters_billion": 122.0,
   "quantization": "Q4_K_M",
   "weights_memory_gb": 81.2,
   "reasoning_depth": "deep",
   "prompt_tokens": 120,
   "reasoning_tokens": 4096,
   "duration_sec": 1545.52,
   "tokens_per_sec": 2.65,
   "ttft_ms": 231.0,
   "latency_percentiles": {
    "p50_ms": 377.32,
    "p90_ms": 396.19,
    "p95_ms": 422.6,
    "p99_ms": 482.97,
    "mean_ms": 384.87
   },
   "apu_power_mean_watts": 96.0,
   "wall_power_mean_watts": 125.93,
   "total_joules": 194634.58,
   "joules_per_token": 47.5182,
   "joules_per_1k_tokens": 47518.21,
   "effective_bandwidth_gbps": 215.2,
   "bandwidth_saturation_pct": 84.06,
   "cost_per_million_tokens_usd": 1.8479,
   "execution_mode": "empirical_calibrated_telemetry"
  }
 ],
 "memory_bandwidth_saturation_curve": [
  {
   "weights_gb": 5.8,
   "effective_bandwidth_gbps": 222.0,
   "saturation_pct": 86.7,
   "model": "9B Q4_K_M"
  },
  {
   "weights_gb": 9.1,
   "effective_bandwidth_gbps": 223.0,
   "saturation_pct": 87.1,
   "model": "14B Q4_K_M"
  },
  {
   "weights_gb": 9.8,
   "effective_bandwidth_gbps": 223.4,
   "saturation_pct": 87.3,
   "model": "9B Q8_0"
  },
  {
   "weights_gb": 18.5,
   "effective_bandwidth_gbps": 223.8,
   "saturation_pct": 87.4,
   "model": "30B Q4_K_M"
  },
  {
   "weights_gb": 22.8,
   "effective_bandwidth_gbps": 221.2,
   "saturation_pct": 86.4,
   "model": "35B Q4_K_M"
  },
  {
   "weights_gb": 37.2,
   "effective_bandwidth_gbps": 219.5,
   "saturation_pct": 85.7,
   "model": "35B Q8_0"
  },
  {
   "weights_gb": 81.2,
   "effective_bandwidth_gbps": 215.2,
   "saturation_pct": 84.1,
   "model": "122B Q4_K_M"
  }
 ],
 "discrete_gpu_comparisons": {
  "h100_sxm5_cluster": {
   "hardware_name": "NVIDIA H100 SXM5 80GB (8x GPU cluster node share)",
   "node_total_power_watts": 6800.0,
   "gpu_effective_power_watts": 850.0,
   "gpu_hourly_cost_usd": 3.0,
   "batch1_tokens_per_sec": 85.0,
   "joules_per_token": 10.0,
   "cost_per_million_tokens_usd": 9.8,
   "memory_bandwidth_tbps": 3.35,
   "sovereign_spend_usd": false,
   "description": "Commercial datacenter 8-GPU cluster node running TensorRT-LLM"
  },
  "a100_sxm4_cluster": {
   "hardware_name": "NVIDIA A100 SXM4 80GB (4x GPU node share)",
   "node_total_power_watts": 2000.0,
   "gpu_effective_power_watts": 500.0,
   "gpu_hourly_cost_usd": 1.8,
   "batch1_tokens_per_sec": 48.0,
   "joules_per_token": 10.42,
   "cost_per_million_tokens_usd": 10.42,
   "memory_bandwidth_tbps": 2.04,
   "sovereign_spend_usd": false,
   "description": "Datacenter A100 cluster running vLLM"
  },
  "rtx_4090_workstation": {
   "hardware_name": "NVIDIA RTX 4090 24GB (Single GPU workstation)",
   "node_total_power_watts": 550.0,
   "gpu_effective_power_watts": 450.0,
   "gpu_hourly_cost_usd": 0.55,
   "batch1_tokens_per_sec": 40.0,
   "joules_per_token": 13.75,
   "cost_per_million_tokens_usd": 3.82,
   "memory_bandwidth_tbps": 1.01,
   "sovereign_spend_usd": false,
   "description": "Consumer workstation discrete GPU (24GB VRAM limit prevents running 35B+ models without severe offloading)"
  },
  "commercial_cloud_serverless_api": {
   "hardware_name": "Commercial Frontier Reasoning API (Serverless)",
   "node_total_power_watts": 0.0,
   "gpu_effective_power_watts": 0.0,
   "gpu_hourly_cost_usd": 0.0,
   "batch1_tokens_per_sec": 35.0,
   "joules_per_token": 12.5,
   "cost_per_million_tokens_usd": 8.0,
   "memory_bandwidth_tbps": 0.0,
   "sovereign_spend_usd": false,
   "description": "Commercial billed serverless API token rate ($8.00 / 1M reasoning tokens + data egress)"
  },
  "sovereign_strix_halo_apu": {
   "hardware_name": "AMD Strix Halo APU (Ryzen AI MAX+ 395 w/ Radeon 8060S)",
   "node_total_power_watts": 105.0,
   "gpu_effective_power_watts": 85.0,
   "gpu_hourly_cost_usd": 0.0,
   "batch1_tokens_per_sec": 37.0,
   "joules_per_token": 2.84,
   "cost_per_million_tokens_usd": 0.11,
   "memory_bandwidth_tbps": 0.256,
   "sovereign_spend_usd": true,
   "description": "Sovereign unified-memory architecture (122.7GB LPDDR5X) at $0.00 marginal cloud fee"
  }
 }
}
