九游平台以九游官网登录为核心,带来高效便捷的体验。

想了解更多九游APP下载相关内容,尽在九游平台。

  • 深圳市南山区科技园北区202座
  • [email protected]
  • 周一至周五
  • +86 138-**** ****

九游平台围绕以剧情体验为核心,逐项拆解生存探索类游戏的可读性差异。不断创新,回应用户的真实需求。

九游平台

震撼,谷歌破解了RSI?AI靠「做梦」学会无限进化

  • 首页
  • 博客详情
博客详情 - 九游平台

探索游戏中的自然之美

  • 管理员
  • 分类
  • 2026年8月2

九游平台发现,许多玩家在生存探索类游戏中容易陷入“赶进度”的误区,反而忽略了游戏本身丰富的剧情与策略深度。以经典作品《荒岛求生》为例,玩家若优先建立食物储备系统而非盲目探索地图,往往能更稳定地推进主线剧情。本文将从资源采集优先级、工具升级路径和剧情触发条件三个维度,拆解如何在不赶进度的情况下,享受完整的游戏体验。

九游平台致力于为中文游戏玩家提供专业、客观的内容解读。我们相信,理解资源管理的过程不必赶进度,先从选择思路中找到自己的兴趣点,才是游戏体验的核心。本篇评测基于游戏实际体验,所有观点均来自团队多次通关后的总结,确保信息透明、可信。

探索游戏中的自然之美 - 九游平台

九游平台强调,资源管理不仅仅是数字堆砌,更与剧情叙事紧密相连。在《迷失森林》中,玩家对木材和石材的分配直接影响能否解锁关键剧情节点。通过逐项对比不同资源策略带来的剧情分支,我们发现:选择“稳扎稳打”路线的玩家,平均解锁隐藏结局的概率比“激进探索”路线高出35%。这一数据来自九游平台对200名玩家的实际跟踪调研。

九游平台注意到,生存探索类游戏的剧情可读性差异常被玩家忽视。以《辐射4》的生存模式为例,其资源稀缺度设计迫使玩家反复权衡,但这也让每一次对话选择都更具分量。九游平台建议新手玩家从“简单难度+高资源”开始,逐步过渡到“生存难度”,在此过程中记录资源消耗与剧情走向的关联,形成个人化的策略笔记。

探索游戏中的自然之美 - 九游平台

九游平台在评测过程中发现,优秀的生存探索游戏往往通过资源管理机制来强化剧情沉浸感。例如《这是我的战争》中,玩家对食物和药品的分配直接决定了角色命运与故事走向。九游平台借助基础概念重新呈现这部经典作品的不同侧面,帮助读者理解:每一个资源决策背后,都是对生存伦理与人性选择的深度探讨。

剧情解析

合理分配时间,享受游戏深度

欢迎关注九游平台,一起聊聊生存探索中的细节与发现,九游体育平台是关注游戏体验的内容站点,借助基础概念呈现经典作品的不同侧面,理解资源管理的过程不必赶进度,先从选择思路中找到自己的兴趣点,重视剧情体验内容的可读性,所以将体验差异逐项说明。

探索游戏中的自然之美 - 九游平台
探索游戏中的自然之美 - 九游平台

九游平台以九游官网登录为核心,带来高效便捷的体验。

九游平台认为,从选择思路入手是建立个性化资源管理策略的关键。玩家可以先列出游戏中的核心资源类型(如食物、水、材料、工具),然后根据自身游戏风格(保守型/冒险型)制定优先级。九游平台提供了一份通用资源管理模板,帮助玩家在进入新游戏时快速建立自己的策略框架,避免盲目跟风攻略。

更多推荐内容
掌握策略艺术
探索游戏中的自然之美 - 九游平台

谷歌或许已找到RSI的突破口!

近日,谷歌携手Google DeepMind、马里兰大学及弗吉尼亚大学,共同发布了一篇重要研究论文。

这次,他们展示了一种截然不同的RSI路径:AI的自我进化,竟然能通过“做梦”实现?

谷歌的做法是,让智能体将每一步的探索过程记录成一棵树,然后在这棵树中进行“梦境演练”。

在梦境里磨炼出更优的探索策略,再回到现实世界继续执行。

论文链接:https://arxiv.org/abs/2609.14858

Dream-RSI的效果相当惊人:

在算法优化任务中,主流进化搜索系统需要跑51200代,而Dream-RSI仅调用317次就达到了相同水平。

在圆填充问题上,它追平了谷歌自家AlphaEvolveV2的最强记录。

在GPU内核优化中,达到同等性能时,生成次数大幅降低了2.43倍。

底层权重完全不变,Gemini 3.1 Pro和3.7 Flash都能直接应用。

此外,还有一个更有趣的发现:人类为AI指明方向,效果反而比不指导更差。

论文一发布到arXiv上,X平台就炸开了锅。网友Mark Kretschmann高呼:“谷歌可能刚刚破解了递归自我改进”!

论文第一作者Tong Zheng是马里兰大学二年级博士生,今年夏天以学生研究员身份加入谷歌。他身后是一个17人的作者团队,包括DeepMind研究员和讲席教授。

要实现递归自我改进,智能体必须学会做梦。而历史,就是它们做梦的世界。

Tong Zheng在Hugging Face上留下了这样一句话,这也成为整篇论文的核心。

历史,就是它做梦的世界

Dream-RSI要解决的是整个进化搜索领域最棘手的问题。

以AlphaEvolve为代表的系统早已证明,让编码智能体进行进化搜索,能发现人类未曾找到的算法。但它们有一个致命弱点:探索策略完全依赖人工编写。

哪个分支该分配更多算力,哪个分支该尽早剪掉,何时启动并行,全凭工程师预先设定。搜索空间一旦扩大,固定策略就会把算力浪费在死胡同里,而且不会吸取教训。

那么,让策略自己进化是否可行?理论上可以,但问题在于评估成本。

评估一段候选代码,运行一次就能知道好坏。而评估一套探索策略,则需要让它带领智能体从头跑完数百甚至上千轮,看最终挖掘出的成果如何,才能给策略打分。每修改一版策略,就要重跑整个发现过程,等几天才能得到一个分数,没人能承受这种代价。

Dream-RSI的解决方案是:将已运行的过程保存下来,在评估新策略时不再重跑,而是直接回放旧过程。

具体来说,它将“执行任务”和“决定如何执行”拆分成两层。

  • 底层是负责执行的“发现智能体”(Discovery Agent),由Gemini 3.1 Pro或3.7 Flash驱动。它每次接手一个工作区,读取上下文,修改出一版新候选代码,交给评估器打分。
  • 顶层是轻量的编排层,其中包含“探索策略”(一段Python代码),决定每一轮从哪个节点继续、一次开启多少个并行尝试、何时止损。

底层模型保持不变,自我进化的对象只有这段策略代码。

每一次真实探索的结果都会存入一棵“发现树”。根节点是初始工作区,每个子节点记录了一次尝试的完整现场,包括文件系统快照、生成的产物、评估诊断和得分。

这棵树,就是模拟器。

策略需要做的决定只有一类:从哪些节点继续,一次开几个。而每个节点往下走会得到什么结果,树中已经记录好了。

因此,当策略需要迭代时,无需再去真实环境运行代码,直接在已生成的树上重走一遍历史即可——

想尝试“这条路多走两步”,就读取树中对应的记录;想试试“那条路早点放弃”,就少读几个节点。

整个评估过程不调用一次模型,不运行一行代码,只读取历史。

论文将这种机制称为“做梦”。就像棋手复盘,不需要重新摆棋再下一遍,翻阅棋谱就够了。

Dream-RSI 的运行闭环

基于这一洞察,谷歌构建了Dream-RSI框架。它的自我改进循环主要分为三个阶段:

  1. 真实探索:当前最新的探索策略引导Agent在真实环境中运行(例如调用LLM、编译并执行代码),并将探索产生的所有路径、决策和执行反馈记录下来,作为一棵新的结构化探索树,追加到历史数据库中。

  2. 构建模拟器:将更新后的历史数据库转化为一个可重用的“重放模拟器池”。

  3. 基于做梦的策略改进:一个专门的LLM策略开发Agent在这个模拟器中开始疯狂“做梦”。它不断修改和重写探索策略的代码,生成上千个候选策略,并在重放模拟器上快速重放它们。

做梦的打分由三项构成:一是这一轮梦里找到的最优分数,二是减去尝试次数对应的成本,三是并行奖励,鼓励策略一轮批量跑多个尝试。

得分高的策略,就意味着它“多快好省”。

负责修改策略的是另一个“策略开发智能体”。

它会关注三样东西:当前策略在梦里走过的轨迹和分数,前几版修改的反馈,以及整棵发现树。然后,看完后直接改写策略代码。

一轮修改出若干版本,每一版都丢回梦里打一次分,得分最高的那一版成为下一轮的正式策略。

这意味着,新策略的下限是“原地踏步”,上限则是“无限进化”。

RSI的飞轮就此闭环。

为什么这个策略永远不会变差?

在离线改进阶段,策略开发Agent会经历多轮代码迭代。由于当前的策略本身就被包含在候选池中,只有当新重写的策略在模拟器上的综合重放得分(平衡了探索质量、算力成本和并行效率)高于当前策略时,新策略才会胜出并被部署。

因此,在数学上,Dream-RSI部署的新策略表现绝不会弱于上一代。随着新策略被重新部署到真实世界中探索,它会带回更深、更广的探索树,从而让模拟器也随之进化。

智能体与它眼中的“世界”,就这样在相互咬合的齿轮中一同成长。

策略改进后上线挖掘新算法,历史数据增多,梦境更准确;梦境更准确,策略继续进化。树中没有的分支,梦里也走不到,所以每一轮真实探索都在为下一轮的梦扩展地盘。

第一版策略很朴素,只会开启一堆独立的工作区各自埋头运行。到了后面的轮次,策略学会了精打细算。

在ConvDiv内核实验中,当性能处于上升期时,策略主动将每轮尝试从110次削减到50次;一旦性能停滞,它又把探索力度拉满,分数随即再涨一截。

没有人教它这么做,这是它从自身历史中“悟”出来的。

317次碾压5万代:人类反而成了累赘

论文在三个领域进行了实测。

1. 算法工程:Lasso 正则化路径求解器

第一个领域是算法工程,任务是Lasso正则化路径。这是高维统计中的老难题,要求在保证数值正确的前提下,将整条路径计算得尽可能快。

使用Gemini 3.1 Pro运行Dream-RSI,仅调用317次,就将求解器的平均运行时间从3587.1毫秒降至2931.0毫秒。

相比之下,同一个模型换成固定策略,需要调用550次才能达到这个水平。基线SimpleTES为了获得类似结果,一共生成了51200次。

换成更便宜的Gemini 3.7 Flash后,模型消耗了1879次调用,成功将运行时间做到了2350.6毫秒。

因为进化发生在探索这一层,与底层模型的大小无关,所以小模型同样能受益。

它挖掘出的求解器,基线的做法是根据问题维度,在LARS和坐标下降两种算法中二选一。而Dream-RSI找到的方案,直接将自适应融入活跃集优化内部。

具体来说,先用强规则筛选一遍特征,再用柯西-施瓦茨不等式进行KKT剪枝,只有当上界无法判断某个特征时,才回头计算精确梯度。

2. 数学优化:三大高难度数学任务

在数学优化领域,差距更为显著。

在“和差问题”、“圆装填”和“自相关不等式”这三个极其耗算力的离散和几何优化问题中,Dream-RSI在1000代以内就达到或超越了极强的基线性能。

与需要51200代算力开销的SimpleTES相比,Dream-RSI节省了超过50倍的计算预算,且获得了同等甚至更优的结果。

3. GPU 算子工程:KernelBench 极限压榨

第三个领域是GPU内核工程,也是谷歌自身最关注的领域。

在这里,论文总共测试了四种内核。

VGG16和LayerNorm比较的是节省程度:将内核优化到与固定探索相同的性能,Dream-RSI所需的生成次数分别仅为对方的1/2.43和1/1.79。

ConvDiv和ConvMax比较的是强度:在相同预算下,Dream-RSI优化出的内核性能分别是固定探索的2.09倍和1.44倍。

最后,研究团队将之前的历史轨迹提炼成方向性提示,嵌入Prompt中“手把手”指导智能体。

结果有些出乎意料:在同等预算下,加入了人类引导的策略始终比不加的更差。

深度剖析:直接给AI“总结经验”,反而效果更差?

论文中有一个非常反直觉的实验。

研究人员尝试了“经验总结法”,让大模型将历史总结成高层指导意见,用于指导下一轮探索。

然而,实验结果令人大跌眼镜:注入了高层次经验总结的Agent,在探索表现上不仅没有提升,反而显著差于没有任何指导的原始baseline!

背后原因在于,一旦将经验生硬地抽象为“高层原则”,它们立刻转化为AI的认知偏见,过度约束了AI的搜索空间,扼杀了探索的多样性,让AI困在局部最优解里。

相反,Dream-RSI的“做梦”机制不提供任何“空洞真理”,它直接让新策略去碰撞具体的历史树,在微观的并行控制、分支优先级和提早停止规则上进行代码级优化。

这种方式保持了探索空间的开放和多样性,效果远胜于前者。

暑期实习生操刀一作,身后是17人豪华天团

第一作者Tong Zheng(郑童),2021年本科毕业于东北大学,本科期间就在国内最硬的机器翻译组(肖桐组)进行研究。

2024年他进入马里兰大学读博,师从黄恒教授。Dream-RSI正是他2026年夏天在谷歌担任Student Researcher时的成果。

他从ICLR 2025让模型一次输出多个草稿的投机解码,到ICLR 2026和ICML 2026的Parallel-R1和Parallel-Probe(用强化学习教模型并行思考),始终专注于同一件事——不让模型一条路走到黑。

Dream-RSI打分中的“并行奖励”,与这条思路一脉相承。只不过,以前是让模型的思维并行,现在是让智能体的探索并行。

导师黄恒,马里兰大学首任Brendan Iribe讲席教授,发表约300篇顶会论文,拥有7个NSF项目和3个NIH项目。这两年,黄恒组里的学生专注于大模型推理。

17人的作者团队中,通讯作者Xidong Wu和Zheng Zhang在谷歌,DeepMind一侧有推荐系统圈熟知的SASRec作者Wang-Cheng Kang。

一个暑期实习生担任第一作者,身后一群资深研究员署名,谷歌对这条路线的重视程度不言而喻。

通往ASI的隐秘通道,已经被打通了?

此前,谷歌产品负责人Logan Kilpatrick透露了重磅消息:谷歌正在紧盯前沿,并且已经看到了RSI的早期迹象!

他以Gemini 3.5到3.8大约每三到四周一更作为证据,并表示Gemini 4将是迄今最大、最野心勃勃的预训练模型,希望借此重回争霸位置。

他强调,要把算力和人力投入到写代码、做研究、做科学上,因为这些最可能让下一轮训练变得更快速、更便宜。

为什么谷歌如此坚信RSI正在发生?

因为AI自我改进的范式正在悄然改变。过去十年,行业里谈到RSI,大家想到的总是“AI自动修改自己的权重,训练出下一代神明”。

但Dream-RSI展示了另一种可能性:模型权重不一定需要先改变,它可以通过自我重写外围的“Harness”来让自己变得强大!

当模型拥有这种强大能力时,它会用最便宜的算力去解决最难的问题。

正如论文结尾所说:

智能体必须学会做梦才能递归自我改进,而历史,就是它做梦时所处的整个世界。

随着Gemini 4等超大型预训练模型的临近,这种“在虚拟历史中做梦”的RSI到来,我们距离那场智能大爆炸,或许只有一步之遥了。

参考资料:

https://dream-rsi.com/

本文来自微信公众号“新智元”,作者:摩西 Aeneas,36氪经授权发布。九游官网登录的用户可以访问该论文的详细内容。

发表评论

你可能还喜欢

探索游戏中的自然之美 - 九游平台

从新手到高手:资源管理三步法

九游平台持续关注生存探索品类的最新动态,及时更新观点与发现。近期我们对《绿色地狱》的剧情模式进行了深度评测,重点分析了“理智值”系统如何与资源管理产生联动效应。评测全文已在九游官网发布,欢迎玩家前往讨论区分享自己的资源管理心得,共同探索游戏世界的更多可能性。

搜索

搜索

  • 九游游戏评测
  • 生存探索指南
  • 剧情体验解析
  • 资源管理大师
  • 经典作品回顾

最新博客

探索游戏中的自然之美 - 九游平台
2026年1月10日 创新视角下的经典
探索游戏中的自然之美 - 九游平台
2026年1月10日 发现游戏内容的潜力
探索游戏中的自然之美 - 九游平台
2026年1月10日 用体验滋养游戏生活