3分钟生成完整游戏:Qwen3.8稳、3.7懂孩子,国产大模型的「聪明与稳重」分叉
日期:2026-07-28 18:00:02 / 人气:30

当下大模型的比拼,早已不再是“能不能写代码”“能不能做内容”的基础较量,而是能不能读懂真实人性、能不能稳定落地体验、能不能适配普通人直觉需求的深层博弈。一场带娃实测的小游戏迭代实验,清晰撕开了Qwen3.7与Qwen3.8两代旗舰模型的核心差异:3.7更聪明、更懂人的潜台词,3.8更稳重、更可控、更能保证落地体验。前者擅长精准共情,后者坚守工程稳定,完美诠释了AI迭代路上,“灵性”与“稳健”的经典取舍。
这场测试源于一次真实的假期带娃日常。亲戚家小孩写完作业后好奇AI能力,随口提出各类游戏需求,全程由孩子自由提需求、人工辅助交互,先用Qwen3.8-Max-Preview实时生成、迭代游戏,晚间再用完全一致的指令复盘Qwen3.7-Max,两轮完整对照,模型差异被无限放大,结果极具参考价值。
01 初代生成:一句话生成完整游戏,两代模型各有加成
孩子最初的需求简单直白、毫无修饰:“我要一个游戏,有猫,能跳,还要打东西。”
Qwen3.8用时3分钟,直接产出575行完整可运行代码,一键生成《猫咪大冒险》平台跳跃游戏。自带暗色星空背景、橘猫尾巴动态动画、三种差异化敌人、连击计分系统、道具掉落机制、粒子特效,500分通关闭环完整。操作逻辑清晰易懂,键盘操控流畅无卡顿、无BUG、无闪退,孩子上手即玩,体验完整可控。
复盘测试的Qwen3.7表现更为激进灵动,在相同原始指令下,直接输出708行代码,功能全面超额交付:自动弹出浏览器运行窗口、增设专属开始游戏按钮,无需二次调试,更提前预判孩子对战需求,原生自带激光攻击、飞狗怪物机制,在用户未提及的前提下,主动丰富游戏玩法与视觉层次。
两代模型的共性极强,都能精准捕捉口语化模糊需求,将一句大白话转化为完整游戏引擎。但差异初见端倪:3.8严格落地显性需求,做足基础闭环;3.7主动挖掘隐性需求,超额叠加趣味功能。AI不再是机械执行代码的工具,而是拥有不同“性格”的交互主体。
02 迭代核心差异:3.7智能优化,3.8覆盖重做
孩子通关后提出第一轮迭代需求,暴露了两代模型最核心的逻辑分歧。因空中小鸟体积小、速度快、难以击中,孩子随口调整规则:“我要猫能发射激光,按空格发射,打中东西就爆炸。”
孩子并未留意,空格键原本绑定跳跃功能。Qwen3.8严格遵循最新指令,直接覆盖原有按键逻辑:空格改为激光发射,跳跃功能迁移至W键。功能虽能正常使用,但破坏了原有操作习惯,导致孩子短暂困惑,游戏体验出现断层。
而Qwen3.7展现出极强的语境理解与需求判断力,没有粗暴改写代码,而是全局复盘、针对性优化。它精准识别核心痛点:飞鸟判定范围小、飞行速度快、游玩门槛高,在保留原有全部功能、操作逻辑不变的前提下,加宽激光判定范围、强化打击特效、减缓飞鸟移速、优化爆炸反馈,精准解决孩子的真实游玩痛点,完美兼顾新旧功能与游玩体验。
这一刻的差距本质清晰:3.8是执行层AI,优先满足最新指令;3.7是产品层AI,优先理解用户目的。一个守规则、一个懂人心。
03 需求模糊迭代:灵性过头与精准稳妥的取舍
第二轮迭代,孩子提出模糊修改需求:“紫色的东西太恶心了,改成狗,狗要会飞。”
Qwen3.8精准识别“紫色物体”对应初代史莱姆,严格执行替换指令,将其改为带白色翅膀、正弦轨迹飞行的棕色飞狗,保留两次击杀的设定。但形态、玩法与原有飞鸟高度重合,孩子直言“换汤不换药,还是鸟”,迭代效果不达预期。
反观Qwen3.7,因首轮已主动生成飞狗怪物,本轮无对应史莱姆可替换,直接跳过无效迭代,避免多余改动、不破坏现有游戏生态。看似没有响应需求,实则是读懂迭代语境、拒绝无效改动的高阶智能体现。
04 场景认知鸿沟:赛跑VS对战,理解能力高下立判
单人模式游玩枯燥后,孩子提出核心玩法升级需求:“一个人玩没意思,我要两个人一起玩,两只猫抢鱼干,谁抢得多谁赢。”
两代模型的理解偏差,直接重塑了整个游戏的玩法逻辑。
Qwen3.8抓取“抢鱼干、比拼输赢”的表层语义,直接彻底重写游戏框架。删除激光攻击、怪物、连击、爆炸等全部原有对战功能,将平台打怪游戏,完全改成双人跑酷竞速模式。两只猫咪无交互、无对抗,仅各自追逐鱼干比拼数量,彻底丢失对战乐趣,孩子直言“不好玩”。
Qwen3.7精准拿捏孩子的核心诉求:双人游玩的本质是互动对抗,而非单纯竞速。它完整保留激光打怪、飞狗怪物等原有核心玩法,同时新增双人对战机制,独创趣味交互逻辑:激光击中对手可造成0.75秒眩晕+击退效果,兼顾打怪积分与玩家对抗,玩法层次瞬间拉满,高度贴合孩子的游玩预期。
05 致命BUG:聪明的代价,稳定才是体验底线
发现双人竞速玩法无趣后,孩子再次修正需求,回归核心乐趣:“两个人都能发射激光打飞狗,谁打的飞狗多谁赢。”
两轮模型均成功召回激光、飞狗、计分对战核心玩法,但稳定性差距彻底拉开。
Qwen3.8依旧保持极致稳定,60秒对局时长精准可控,怪物刷新、移速、伤害全部参数均衡,无异常波动,孩子可以反复游玩、体验稳定,全程流畅无崩坏。
极具戏剧性的是Qwen3.7,虽然玩法逻辑更贴合需求,但出现致命底层BUG。其对局时间采用帧驱动计数(gameTime++),默认绑定60帧标准屏幕,而高刷屏设备帧率更高,直接导致计时加速失真:原本60秒的对局,实际8秒就强制结束。更严重的是,游戏难度系数与运行时间强绑定,时间加速带动怪物移速、刷新频率暴涨,飞狗满屏乱飞、激光瞬间被淹没,游玩体验彻底崩盘。
这也是两代模型最扎心的差距:3.7足够聪明、共情力拉满,却容易出现底层工程漏洞;3.8不够灵动、略显刻板,却守住了体验稳定的底线。聪明若无稳定兜底,反而会毁掉完整体验。
06 落地短板:AI普遍的最后一公里困境
整场实测中,两代模型暴露了完全一致的落地短板,也是当前生成式AI的共性痛点:只能本地运行,无法便捷部署,移动端完全失效。
孩子想要分享游戏给朋友,实测发现本地HTML文件仅适配键盘操作,手机打开后无交互控件,画面静止、无法游玩,沦为动态壁纸。
尝试云端部署时,Qwen3.8输出21步复杂部署流程,涵盖环境安装、编码处理、域名适配等操作,最终因网络问题部署失败;Qwen3.7简化流程,直接给出授权链接,但依旧需要注册账号、配置环境,对普通孩子而言,等同于完全无法分享。
除此之外,两代模型均不支持游戏存档,迭代后的趣味玩法无法留存,次日只能重新生成。孩子最终无奈放弃:“还是玩别的吧,那个不会丢。”AI生成的极致乐趣,终究败给了无法留存、无法传播的落地短板。
07 彩蛋与终极结论:AI的两种进化方向
实测最后尝试趣味需求:“加个背景音乐,放《孤勇者》。”Qwen3.8精准调用Web Audio API,合成8-bit复古旋律,方波主旋律、三角波低音、噪声鼓点,完整复刻曲目节奏,技术落地精准无误,只是跟不上当下孩子的审美潮流。
整场实测下来,Qwen3.7与Qwen3.8的优劣取舍、进化方向彻底清晰:
Qwen3.7-Max,是更懂人的AI。它擅长读懂口语化模糊需求、捕捉潜台词、理解用户真实目的,迭代优先优化体验而非机械执行指令,共情力、产品感、灵活性拉满,更贴合普通人的直觉交互,但存在底层工程BUG、稳定性不足,聪明有余、稳重不足。
Qwen3.8-Max-Preview,是更靠谱的AI。作为迭代升级版本,它工程稳定性、代码规范性、落地可控性全面提升,不会粗暴改写原有功能、不会出现底层逻辑漏洞,输出结果稳定可预期、体验均衡无翻车。虽然不够灵动、偶尔刻板,迭代容易跑偏,但能稳定交付可玩、可用、无BUG的成品,是真正适合落地商用、日常使用的工具型AI。
这正是当下大模型行业的终极取舍:聪明靠算法理解,稳定靠工程打磨。3.7代表AI的灵性与共情,3.8代表AI的成熟与落地。
大模型早已告别“参数越大越强”的单一竞赛。真正的顶级AI,不是最会猜人心的AI,也不是最会写代码的AI,而是既能读懂人的温柔需求,又能守住工程的稳定底线。
而这场带娃实测最动人的瞬间,从来不是三分钟生成一款完整游戏的AI魔法,而是孩子临走前的期待:下次再来,做一个可以存档、可以分享、永远不会丢失的游戏。这也是下一代AI落地,最值得奔赴的终极方向。
作者:奇亿娱乐
新闻资讯 News
- 老牌高跟鞋玖熙想在中国卷土重来09-13
- 欧莱雅为什么要投一个抖品牌?09-13
- 美债剧烈震荡、全球市场恐慌!罕...09-13
- AI末日论持续发酵:业内频发风险...09-13

