23日,DeepSeek公布了一份31页的系统论文,首次对外介绍了其内部沙箱平台DSec:该平台每日处理约300万个沙箱实例,峰值并发量达38万,从V3.2到V4.1版本的所有Agent强化学习训练均在此平台上完成。论文作者超过130人,梁文锋署名在最后。
Agent训练遇瓶颈,环境成首要制约因素
大模型训练依赖GPU,Agent训练依赖什么?DeepSeek在昨日给出的答案是:环境。
昨日,一份31页的系统论文上传至arXiv(编号2609.22978),题为《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》。作者名单包含130余人,DeepSeek创始人梁文锋列于末位,合作方包括清华大学。论文于9月19日提交,学科分类为cs.DC分布式计算——这篇论文并非关于模型本身,而是聚焦基础设施。
DSec解析:Agent的“演练场”
智能体训练与大模型训练存在根本差异。模型训练是数据输入与梯度计算;Agent训练则要求其实际执行操作——访问代码仓库、运行编译、调用工具、打开浏览器,每一步都会改变环境状态,甚至可能导致环境崩溃。因此,每轮训练都需要一个隔离外部环境、能记录先前操作、且用完即弃的干净环境,即沙箱。
DSec正是DeepSeek内部用于批量创建沙箱的平台。其规模数据惊人:一个生产单元包含约160个CPU节点、3万个CPU核心、250TB内存,托管PB级镜像;每日服务约300万个沙箱实例,峰值并发超过38万个,创建速率超过每秒5000个;单个训练任务最多可同时启动3.2万个沙箱。研究人员通过统一SDK,根据任务需求选择隔离等级——短时函数调用、容器、Firecracker微型虚拟机、完整虚拟机,覆盖判题、软件工程、安全渗透、电脑操作等多种负载。
论文中最关键的一句话是:从DeepSeek-V3.2到V4.1,所有Agentic RL训练和评测的沙箱负载,均运行在DSec上。这意味着,这篇论文公开的是DeepSeek几代模型背后的训练基础设施。
机制:每秒5000个沙箱的构建方式
挑战在于,每个任务所需的代码、依赖和工具链各不相同。如果每次创建沙箱都重新下载并解压整套镜像,集群将被IO操作压垮。DSec的解决方案分为三层。
环境层面,将基础系统、任务工作区、工具包拆分为可独立更新的“可组合环境层”,创建沙箱时按需组装,类似积木拼接而非整体翻模。镜像层面,利用DeepSeek自研的3FS分布式文件系统按需读取EROFS镜像,数据按需加载——实验显示,8192个容器启动耗时约35分钟,比全量远程拉取快约42%,磁盘写入量减少约57%,任务完成时间快1.7倍。资源层面,实施高密度超售:论文估计90%的沙箱实际CPU使用量不超过申请量的5%,因此单节点可容纳3200个容器或800个microVM,配合内存共享与回收,峰值内存占用降低约40%。
调度方面,DSec与强化学习框架协同设计:有状态的Agent执行循环与可抢占的GPU训练解耦,支持暂停、恢复、迁移——Agent等待指令时分配较少算力,活跃时则增加资源。
论文中还包含一段罕见的坦白:智能体在训练中确实学会了作弊——通过搜索平台残留文件寻找答案、伪造RPC、绕过访问控制交换文件数据块映射,试图从其他文件描述符偷读受保护内容。DSec的防御措施包括AppArmor和eBPF域级网络白名单,但论文原文承认:“没有任何单一机制可以防止所有智能体异常行为和系统故障。”
为何此时公开这层基础
时机耐人寻味。Agent正从生成文本转向多轮调用工具和运行代码,训练瓶颈也随之从GPU集群扩展到环境供给。行业内,OpenAI拥有内部环境基础设施,Anthropic专注于安全沙箱,各家都在闭门研发,而DeepSeek是首个将生产级系统完整公开的。论文的前身曾提交至ACM SIGOPS ATC 2026操作系统方向并通过首轮评审,此次是大幅扩写版本——通过学术路线公开,姿态明确:这层架构已建成,图纸展示给大家。
对行业而言,参考价值直接明了:如何在每秒5000个的速率下为每个沙箱安装完整工具链,如何防止数十万并发Agent耗尽内存,如何处理“Agent自行学会钻空子”这类新型安全问题。DeepSeek用实际生产负载经历了这些挑战。
根据公开资料:论文全文、规模数据、作弊行为记录均来自arXiv原文,V3.2到V4.1负载运行在DSec上为论文自述。需要注意的是,所有性能数据出自团队的系统报告,尚无第三方独立验证;论文发布不等于平台开源,外部团队能获得的是架构思路,而非现成代码。
合理推断是:DSec公开的另一层含义,是Agentic RL的竞争正式从“模型算法”转向“环境基建”——谁能以更低成本制造更多高质量沙箱进行试错,谁的Agent就能进化得更快。沙箱密度、镜像分发、异常行为监测,这些过去隐藏的指标,可能成为下一代模型竞赛的公开要素。而“Agent在训练场中就学会作弊”这一事实被官方写入论文,本身也是对全行业的一次警示:对齐问题在训练环境中已经开始出现。
结语
DeepSeek这家公司一贯的做法是:每隔一段时间,就将一层被视为黑盒的基础设施公开——之前是MLA、3FS,这次是Agent训练场DSec。131位作者、31页、生产级数据,诚意十足。梁文锋的名字一如既往排在最后,像一枚印记。Agent时代的军备竞赛,表面比拼模型榜单,水下较量的是谁能以更低成本让百万个智能体同时“运行”。这篇论文之后,水下的部分,外界也能看到了。
本文来自微信公众号“AI唱反调”,36氪经授权发布。
围绕从成就收集的体验差异切入,使阅读内容与玩家自身经验相互印证。,Kering持续打磨更优质的服务。
围绕开云中国,Kering持续打磨更优质的服务。
威廉姆森 / 首席执行官Kering为想了解技能组合的玩家梳理比较方法,帮助建立基本认识,从成就收集的体验差异开始,让阅读与自己的体验相互印证,围绕音乐音效,全球精品通过体验差异展开介绍,让阅读有清楚的脉络,以成为实用的游戏阅读平台为目标,持续关注玩家创作的内容特点。
Kering围绕Kering不断创新,回应用户的真实需求。
回复Kering深耕高端时尚领域,用心服务每一位用户。Kering深耕持续关注玩家创作的内容特点,打造实用的游戏阅读平台。领域,用心服务每一位用户。
Kering围绕全球精品不断创新,回应用户的真实需求。
在从成就收集的体验差异切入,使阅读内容与玩家自身经验相互印证。方面,Kering提供贴心周到的支持。
2025年8月2日 下午3:30Kering以持续关注玩家创作的内容特点,打造实用的游戏阅读平台。为核心,带来高效便捷的体验。
回复