五个模型被关在一个 prompt 里互殴
· 阅读约 3 分钟
Tokenless 这玩意儿,YC 撑腰,DeepMind、普林斯顿、伯克利那帮人搞的。主打砍推理账单。我一开始以为是前面挂个小模型当保安分流,这套路见怪不怪了。
盯着看了一会儿,发现不是。它干的事挺疯的,画开看看:
你的请求进来了
│
▼
┌────────────────────────┐
│ 同时发给了好几个模型 │
│ Claude、GPT、Gemini… │
└────────────────────────┘
│
▼
盯着它们做题(观察推理过程)
│
▼
哪个先答对 ──► 立刻掐断其他所有调用
看明白了吗?不是猜哪个模型能行,是让它们同时跑,谁先交卷且做对了,就用谁的。没交卷或者做错的,直接杀进程。你最后只为那个胜出者的 token 付钱。
同一个 prompt 让五个模型一起跑,我以前脑子里闪过这念头,马上自己否了——太奢侈。但它的核心赌点在于:推理模型现在真的很啰嗦。
打个比方:三个学生做同一道大题。A 花了两分钟,写了三页纸,推理链拉得老长,算出来 42。B 花了十秒,写了两行,算出来 42。只要系统判定 B 答对了,A 那两分钟的算力直接掐掉不给钱。
这个比喻在这里有个地方漏风,老实标出来:学生做错题最多扣分,模型跑飞可是实打实烧 GPU。Tokenless 在后台是真金白银把这些请求分发出去跑了。它赌的就是"一旦判定正确就 kill 掉其他请求"省下的钱,比同时并发多跑的那点初始算力多得多。
扯远了。这个机制能成立,有个大前提——这帮模型现在是"思维溢出"的重灾区。
为了写个正则,它能先把正则历史盘一遍。这种过度思考是通病,而 Tokenless 恰恰盯上了这块肥肉。它默认一个事实:同一个难题,总有一个模型能用最短的推理链蒙对。你只为那个最短、最准的路径付钱。
我自己上手跑了一下。API 端点跟 OpenAI 那套完全兼容,base_url 一换,代码一行都不用改。
看了一眼官网那个计算器。一个月烧 4 万刀,能给你降到 2.6 万,省了三分之一多一点。账面上 42% 的请求会被判定为"能提前结束",从而重路由。这数字挺诚实的,没敢吹"砍掉 80%",毕竟同时并发跑多个模型的前期固定成本摆在那里。
但这里有个我还没完全画明白的地方。基准测试里列了 τ³-Banking、Terminal-Bench 这些我听都没听过的新名词。解决率先不管,重点是平均每任务成本大概 0.57 美元。这单价怎么算出来的?同时跑几个模型,前几秒的算力是谁在补贴?是他们自己垫钱,还是云厂商给的并发算力有夸张折扣?
这一段我也还没搞透,先放在这里,懂了再补。
不过这不影响我为这个机制兴奋。这玩意儿真的太酷了。✨
以前咱们调 API,就像点了一道菜,厨师在后厨怎么熬汤,你都得为这道菜买单。现在相当于你同时点了五个厨师,谁先炒出来且味道对,你付谁的钱,剩下的直接把锅砸了。
下期想画开的是:如果"观察推理过程"这一步本身也是靠 LLM 来做的,那这不就是一个套着监控外衣的超级 Agent 吗?这玩意儿的套娃边界到底在哪?
评论
还没有评论,写下第一条讨论。