【ALENG 自媒体】10月1日晚间自媒体专稿,一家平时让你点外卖、订酒店、买电影票的公司,突然宣布自己拥有了一颗“1.6万亿参数”的大脑——而且,这颗大脑能写代码,写出来的东西还真能跑。这个公司叫美团,这个大脑叫 LongCat-2.5-Preview。当你还在用它比价哪家店满减更划算的时候,它已经悄悄把战线拉到了大模型的最前沿。这事儿,值得聊一聊。
先说这次美团到底端出了什么。
据观察者网等媒体 10月1日报道,美团 LongCat 团队上线的 LongCat-2.5-Preview,总参数规模达到 1.6 万亿,每次推理实际激活约 480 亿参数。它走的是当下主流的“专家混合”(MoE)路线:参数是攒得多,但真正干活时只点亮一部分,既撑得起体量,也压得住成本。更扎眼的是两个数字——100 万 Token 的上下文窗口,以及官方宣称的“原生多模态”:文字、图片、语音往后大概率能一起喂进去。
最让人意外的是,它会“动手”。
模型不只是能陪你聊天。官方给它的能力清单里,赫然列着终端、浏览器、图形界面、电子表格和设计工具——换句话说,它能像个人类助理那样,自己开浏览器、点按钮、填表格、改设计图。这类本事行话叫“智能体”(Agent),是当下大模型从“陪聊”走向“干活”的关键一跃。为了验成色,有媒体把 LongCat-2.5 接进了 Claude Code 这类编程智能体框架,让它连续跑三个真实 Coding 任务:复刻 Meta Muse 的前端界面连同电影票预订交互、用 Three.js 模拟一次 SpaceX 星舰发射、再开发一款带 AI 赛车、漂移、氮气和排名机制的 3D 赛车小游戏。结果三个项目最终都能跑起来——但单项耗时都超过了 30 分钟。
参数不是目的,能“想长”才是门槛。
一个送外卖起家的平台,为什么要把模型做到这个体量?答案藏在“长程任务”这四个字里。美团的主业是一条极长的服务链条:一个用户请求背后,牵着商家、配送、库存、路线和售后,任何一环都得判断。如果模型只能一轮一轮地答,根本嵌不进这套流程;只有把任务拆解、工具调用和自我纠错做扎实,智能体才可能在真实场景里替掉一部分人工协调。把这事放在更大背景里看,国内大厂这两年在模型上的投入,早已从“比谁参数大”转向“比谁能在真实业务里落地”。美团把“长程”写进定位,等于公开承认:我的主战场是流程,不是写诗。
当然,参数规模从来不是免费的午餐。1.6 万亿的庞然大物,推理时要吞掉海量显存,服务成本远高于中小模型,短期内部署范围注定有限。实测写代码要熬过 30 分钟,也提醒我们这仍是一个预览版,离“秒级交付”还有距离。有意思的是价格:限时折扣期间,缓存未命中输入 2 元/百万 Token、命中只要 0.04 元、输出 8 元——这个价位,摆明了是要在已经白热化的国内大模型价格战里再添一把火。
值得玩味的是,美团用 Claude Code 来给自家模型做“中考”,本身就说明了一件事:在智能体这条新赛道上,工具链和模型正在分家,谁能把“会干事”的体验打磨好,谁才真正握住了下一代入口。至于这颗 1.6 万亿的大脑最终能不能在外卖和本地生活的泥泞业务里站稳脚跟,光看发布会的参数没用,得等真实调用数据说话。但至少今天,那个帮你点午餐的 App,已经朝着“能自己写代码”的方向,迈出了不小的一步。