看来 qwen 3.8 max 的发布暂时威胁不到 tipo🤡
Jason Zhu
今天8月3号,阿里正式发了Qwen3.8 2.4万亿参数,1M上下文,编程和办公能力这一版提升很猛,整体挤进全球第一梯队 预览版跑了两周,今天正式毕业 我第一时间拿它做了个硬核实测,先把结论和过程摊开 我出了一道挺狠的题:单文件HTML手搓一个「星系碰撞」N-body模拟
6000+粒子、双旋涡、真引力物理、潮汐尾,还要带拖拽缩放播放和中文数据面板 同一道题,我让四个模型各写一份,2×2同屏跑 这题狠在它是复合任务,物理加渲染加UI加交互,还得长时间运行才露馅
截图好看,不等于模拟真
难为你了🤣
应该试了好久才找到这个测试用例吧🤣
Qwen
📢Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉 Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters: - Autono
这怎么打嘛,一出生就被斩杀夭折了😂
Qwen 3.8 Max
Input: $2.0 / M tokens
Output: $6.0 / M tokens
Implicit Caching: $0.25 / M tokens
DS v4 flash
Input: $0.14 / M tokens
Output: $0.28/ M tokens
Implicit Caching: $0.0028 / M tokens
不过,我更期待 Qwen3.8-27B 😆,本地部署还得是 Qwen
Composio
We ran Kimi K3 through 3 more agent harnesses (Pi Agent, OpenCode, and Codex) bringing the comparison to 6 harnesses across 26 agentic tasks. 2 things stood out: Codex ranked last on success despite mid-pack speed and cost, while Claude Code cost ab
kimi code 和 pi 性能好,省 token 我还能理解,万万没想到 hermes 竟然也能排到前3
看来以后我只需要一个 hermes 就够了😏😏