config.json
| 1 | { |
| 2 | "algorithm": "PPO", |
| 3 | "library": "stable-baselines3", |
| 4 | "base_environment": "LunarLander-v3", |
| 5 | "model_filename": "ppo-LunarLander-v3-flip-128x128.zip", |
| 6 | "reward_version": "v5-soft-touchdown-refinement", |
| 7 | "reward_config_filename": "reward_config.json", |
| 8 | "reward_wrapper_filename": "flip_landing_reward_wrapper.py", |
| 9 | "observation_dimensions": 11, |
| 10 | "architecture": { |
| 11 | "actor_layers": [ |
| 12 | 128, |
| 13 | 128 |
| 14 | ], |
| 15 | "critic_layers": [ |
| 16 | 128, |
| 17 | 128 |
| 18 | ] |
| 19 | }, |
| 20 | "evaluation": { |
| 21 | "n_episodes": 100, |
| 22 | "mean_shaped_reward": -413.80892156538437, |
| 23 | "std_shaped_reward": 213.20887834470014, |
| 24 | "shaped_course_score": -627.0177999100845, |
| 25 | "min_shaped_reward": -1183.712121425813, |
| 26 | "max_shaped_reward": -294.95529900279223, |
| 27 | "mean_original_reward": -671.0025925747099, |
| 28 | "std_original_reward": 62.16580799530145, |
| 29 | "original_course_score": -733.1684005700113, |
| 30 | "min_original_reward": -751.9068113021244, |
| 31 | "max_original_reward": -397.9538147700128, |
| 32 | "original_reward_200_rate": 0.0, |
| 33 | "flip_completion_rate": 0.15, |
| 34 | "recovery_completion_rate": 0.09, |
| 35 | "recovery_given_flip_rate": 0.6, |
| 36 | "safe_landing_rate": 0.0, |
| 37 | "flip_landing_rate": 0.0, |
| 38 | "landing_given_flip_rate": 0.0, |
| 39 | "stable_landing_rate": 0.0, |
| 40 | "inside_landing_zone_rate": 0.44, |
| 41 | "outside_zone_landing_rate": 0.0, |
| 42 | "in_zone_crash_rate": 0.13 |
| 43 | } |
| 44 | } |