实测星火X2.5,我用摄像头造了5个「超亚比」体感应用

· 2026-09-08 18:25 · 5 阅读

原创 夕小瑶编辑部 2026-09-08 18:25 北京

家人们,我最近用AI做了个东西,我相信有些家人们上班用得着~

昨天下午,我在工位玩砖块游戏(别问,问就是在体验AI)。

我的Boss刚好端着咖啡路过,屏幕“唰”一下,从游戏切成了一张密密麻麻的Excel预算表。

行列标题、工具栏、选中的单元格,全都有,里面还填着像模像样的预算数据。

Boss凑近看了两眼:“哟,算账呢?”

我:“对对对,我在算最近Token花了多少钱。”

他端着咖啡走了。

屏幕弹出一行提示:“第二张脸已离开。”我点了一下恢复,砖块接着飞,分数还在。

这个厉害吧!这是我让AI给我做的【老板来了】,用的AI是科大讯飞昨天发布的星火X2.5。

官方说,这次重点提升了代码和智能体能力,那我就来测测。

现在让AI写个网页已经不稀奇了,我在想我们能不能测得稍微有趣一点?

我想看一段需求交给它,最后能不能变成一个玩得起来且有趣的应用。比如说把一些想法做成体感交互的小应用,可以把摄像头、动作识别、画面渲染和交互规则接到一起。

我管这类玩法叫「超亚比」体感,这个词借了《奥拉星》里强化到顶的设定——

意思就是比普通交互更进阶、更带感。

伸手抽张签,给打工人一点好运

第一个需求是,我想给打工人加一点精神补给:做个不用鼠标、伸手就能玩的“今日签”。

需求是这样的:让一张张签卡组成悬浮的 3D 卡片球,摄像头识别我的手。张开手掌左右拨动,卡片球跟着转;拇指和食指捏在一起,就把选中的卡片抽出来,放大到眼前。看完松手,再把它放回去。

比起单纯生成一段漂亮动画,我更想试试,隔着屏幕,能不能有一点“亲手拿起东西”的感觉?

技术上来分析就是,手势识别和画面反馈能不能接起来。

这里的难点,是让选卡、捏住、移动、松开这几个动作连起来。手指指向哪张,抽出来的就应该是哪张;捏住不放,卡片也不能反复弹出。

第一次打开网页,卡片倒是在飘,我对着摄像头抓了半天,没什么反应。。。

后来发现,抓取的判定阈值设得太死,我又让它调整成动态阈值,效果就出来了!

手伸进摄像头画面,屏幕上会出现对应的手部轮廓。

我在卡片球前移动手指,选中的卡片随之亮起;拇指和食指一捏,那张卡片便从卡片群里抽出来,放大到眼前。

这个体验比我预想的好。

原本只是网页里的一个元素,现在多了点可以伸手去拿的感觉。

既然能拿起来,能不能再把它放到指定位置?

捏住一颗星星,把它送回家

沿着这个想法,我又加了一条游戏规则,再上上难度:识别到捏合以后,再拖到对应的位置,松手才算完成。

于是,就有了“星光捕手”:屏幕上飘着不同颜色的星球,用食指和拇指捏住一颗,拖到同色星门里,再松手放进去得分。

这个需求看起来只是多了个计分,但真正做起来,其实需要考虑的很多。

比如,我捏手指的时候,到底抓哪一颗?总不能手在左边,把右边的星球吸过来。也不能两颗星球挨得近,一把全抓走。

效果是这样:

实际玩下来,延迟不高,抓取、拖动、释放的手感也不错。目前属于已经能玩,但我还想继续盘的程度。

提示词给大家,有兴趣的家人可以拿去盘:

做一个可以用手势玩的“星光捕手”网页。屏幕中漂浮着不同颜色的星球,食指与拇指捏合抓住光标附近的一颗星,移动手可以拖动,松开后释放。把星球送进同色星门得分,送错要反馈但不能加分。设计 60 秒挑战、剩余时间、分数、重新开始以及难度递增。 操作要有明确的瞄准、抓住与释放反馈,捏合时不能隔空抓住远处物体,一次只能抓一颗。手离开画面时暂停或释放并解释当前状态,回来后可继续;重新开始时分数、计时器和物体全部复位,不能叠加多个计时器

我也顺手试了一下前端网站生成。

让它做一个“未来交互展”,把各种新奇的交互方式装进同一个网页展厅。

页面的功能比较完整,首页的3D粒子会随着鼠标移动,跟手程度也不错。

整体来看,最惊艳到我的,还是首页粒子交互的视效。

要我自己写,这部分确实得花点时间动脑子。

老板一入镜,游戏秒变工作表

然后,就轮到开头那个【老板来了】。

这个需求和我老板一样刁钻:

  1. 我的游戏必须真的能玩,有操作有分数,不能是个壳,摸鱼我必须摸的像样。

  2. 表格必须真的像Excel,行列标题、工具栏、可选中可编辑的单元格,一个不能少,不能贴张图片糊弄,老板没有那么好骗的。我还要可复用的,毕竟我的工作内容一直在更新。

  3. 检测到第二张脸要覆盖整个游戏区域并暂停游戏,不是弹个提示就算完。

  4. 人走了不许一惊一乍来回闪,得给手动恢复按钮。

  5. 摄像头只有我主动点才开启。

这绝对是一个好的考题,功能蛮多蛮复杂,需要会写代码+会功能配合+高智商。

来看实测:

实测录屏里,我打着砖块,老板入镜,检测人数从1跳到2,屏幕瞬间切成Excel表,游戏当场冻结。老板离开,提示"第二张脸已离开",点按钮,游戏从暂停处接着来。

我比较满意的就是这个细节做得很好。

“切成表格”只是最显眼的一步,暂停、等待、恢复这些地方处理好了,它才真的能用。而且那张表格里的单元格确实可以选、可以改,并不是贴了一张Excel图片。

我的提示词也给大家,因为我感觉家人们或许用得上【狗头表情】:

所以,这几个案例让我看到的,是星火X2.5能把一个想法做成可运行应用的能力。

一个真能跑起来的应用,是一条完整的链路:调摄像头、做人脸或手势识别、跑3D渲染、处理实时视频流里的噪声。

任何一个环节断掉,前面全白开发了,不只交付代码片段,要交付的是一个能跑、能扛事儿的系统。

赋予我真实魔法

然后,再给大家看两个视觉交互上更有意思的!(我直呼🐮🍺的)。

第一个,双手魔法阵。

双手靠近、拉开、转动,金色法阵就跟着展开、收拢、变化。

我张开双手,金色法阵在身前展开,周围还有飞来的碎片。再向镜头推掌,画面里便出现一波冲击效果。

(Ps:前面是在抓星星,到这里已经开始施法了。。。)

从展开法阵到推掌释放,动作有了连续的玩法,多少有点在工位上练魔法的感觉了。。。

提示词:

另一个是《洛神赋图》手势交互网页。

这个我参考的是博物馆里用手电筒照亮长卷、去看画面细节的体验,让它用摄像头识别手势,把手变成一支“虚拟手电筒”。

从视频中可以看到,光照会跟着手移动,照到哪里,哪里的画面就从暗处显出来,光圈大小也能随手离屏幕的距离变化。

这个效果我还挺喜欢的~~

提示词我也给大家公开了:

请做一个 顾恺之洛神图卷 手势交互网页,参考博物馆中用手电筒照亮长卷、发现故事的体验。 用户打开摄像头后,用一只手在空中移动,就像拿着火把探索:手掌中心控制照明中心,附近恢复底图的清晰细节与暖色,外围逐渐过渡回暗处。光圈边缘柔和,中心明亮但不过曝,直径默认约舞台短边的三分之一;张开手掌光圈变大,握拳变小,变化连续且稳定。无须真实手电筒,不要做成只移动一个发光圆点;核心是局部照亮原图

结语

按照官方公布的信息,星火X2.5采用MoE架构,总参数293B,每次激活约30B,覆盖200多种语言。

不过这次玩下来,我比较有感的是,还是对着摄像头捏星星、开法阵的那几分钟。

以前操作网页,手基本放在键盘鼠标上这次,张开手、握拳、转动手掌,都能变成操作,进一步打破了人机交互的边界,不再是敲击与点击,而是姿态、手势与身体的自然语言,让“意图即执行”成为可能。

另一个让我感兴趣的,是官方介绍,星火X2.5的训练和推理全流程基于国产算力完成。

这背后要解决的事情不少。大尺寸模型要跑起来,计算、通信、显存管理和软件适配都得配合好,换一套硬件,也需要把相应的软件和工程能力补起来。

全国产路线的价值,就在于逐步把这套能力掌握起来:从底层算力到模型训推,遇到瓶颈可以更有针对性地适配和优化,也能减少对特定海外硬件生态的依赖。

对我来说,好奇的落点还是很直接:这套技术最后做出来的模型,面对我这些有点刁钻的需求,到底好不好用?

这次几个案例跑下来,我是愿意继续给它加难度的。

此外,讯飞近期还开源了X2.5-4B和1.7B两个端侧小模型。按照官方介绍,它们原生支持100万Token上下文,在其智能家居控制测试中,指令正确率达到90.3%,平均响应时间为0.85秒。

这部分我还没实测,先记下来,后面有机会再单独盘。

价格也放一下,按平台公布的信息:星火X2.5的价格是输入1.6元/百万Token,缓存命中输入0.24元/百万Token,输出6元/百万Token。

家人们如果也感兴趣,可以去讯飞开放平台试试,最近限免哎:

传送门:

https://maas.xfyun.cn/modelSquare

如果跑出了什么好玩的,评论区分享一下,我也想抄抄你们的作业~

跳转微信打开