← 返回真实案例库
CASE FILE / 游戏与仿真
Jev VS寓言5
Jev VS寓言5.1 VS GPT-6阿斯特拉:国际象棋 typesafe的新Jev V13不是LLM。它不聊天,不解释,不写代码-它只做决定。所以我们让它和边境LLM玩闪电战 测试:5+0闪电战。一举一动都是一次API调用。 Jev V13 vs寓言5.1: ·寓言胜过它。第29步,材料上+16,甚至提拔了第二位女王 ·但分析时每次动作持续燃烧6-15秒。杰夫回答时间约为2.6秒 ·所以寓言没有足够的时间而迷失了 Jev V13 v
● ● ●CASE FILEGUIDE
AI/ML API · @aimlapi
案例拆解
Jev VS寓言5.1 VS GPT-6阿斯特拉:国际象棋 typesafe的新Jev V13不是LLM。它不聊天,不解释,不写代码-它只做决定。所以我们让它和边境LLM玩闪电战 测试:5+0闪电战。一举一动都是一次API调用。 Jev V13 vs寓言5.1: ·寓言胜过它。第29步,材料上+16,甚至提拔了第二位女王 ·但分析时每次动作持续燃烧6-15秒。杰夫回答时间约为2.6秒 ·所以寓言没有足够的时间而迷失了 Jev V13 vs阿斯特拉: ·阿斯特拉并没有费心在材料上获胜。它以18个动作与杰夫对决。QE 1 #,还剩2:27
阅读 526,323喜欢 2,168转发 138
原帖内容
Jev VS Fable 5.1 VS GPT-6 Astra: chess typesafe's new Jev V13 isn't an LLM. it doesn't chat, doesn't explain, doesn't write code — it only makes decisions. so we made it play blitz against frontier LLMs. the test: 5+0 blitz. every move is one API call. Jev V13 vs Fable 5.1: • fable outplayed it. by move 29 it was +16 in material and even promoted a second queen • but it kept burning 6-15 seconds per move on analysis. jev answered in ~2.6s • so fable didn't have enough time and lost Jev V13 vs Astra: • astra didn't bother winning on material. it mated jev in 18 moves. Qe1#, with 2:27 to spare
这个案例说明了什么?
- 游戏状态很适合做成固定选项的决策
- JEV 负责选择,策略或 LLM 负责生成
- 原帖通常有可玩的演示视频