AlexChen1997/fedagent-alfworld-ppo-uniform-1gpu-qwen2.5-1.5b Reinforcement Learning • Updated 10 days ago
AlexChen1997/fedagent-webshop-grpo-hardness-std1-qwen2.5-1.5b Text Generation • 2B • Updated Aug 15 • 15