HyperSight

2026-08AI

面向小米 AI 眼镜的第一视角开放智能底座
查看

项目简介

HyperSight 是面向小米 AI 眼镜的第一视角开放智能底座:眼镜看见你所见、听见你所听,手机与电脑提供随身算力,云端大模型负责思考,把「看见」变成「看懂」,让眼镜从记录世界走向理解世界。同一套技术底座,带来无限可能。

辅助下象棋辅助下象棋 无障碍过马路无障碍过马路 记忆相册记忆相册 手势识别手势识别

幕后花絮

这是我在小米第六届黑客马拉松中的参赛作品,也是之前 MigicCube 项目的延续。

这个项目源于一个简单的想法:

如果我有一副能拍照的眼镜,可以拿它来做些什么有趣的事情?

我脑海中首先浮现的是帮助盲人过马路,看清眼前的世界1

因为我自己就是高度近视,害怕某一天自己用眼过度也会失明,这将是很可怕的一件事情。所以我就未雨绸缪,想要试试看自己能做到哪一步。

之前我在 MigicCube 这个项目当中也做了一些技术储备,当时只是拿眼镜来解魔方,后面给自己挖了一个坑,说将来可以用来辅助下象棋、打扑克等等。

这次黑客松比赛我又继续完成了辅助下象棋的功能,算是填上了之前给自己挖的坑。

后面我又和队友们一起头脑风暴,添加了每日记忆和手势识别等有趣又实用的功能。

我个人非常喜欢手势识别功能,可以实现许多像魔法一样神奇的交互。比如:

  1. 伸手比出打电话的手势,直接和 AI 对话,或者呼叫微信置顶亲友进行视频通话;
  2. 伸出双手比出画框的手势,直接进行拍照。

这些手势都非常符合直觉,但缺点在于需要摄像头一直开启,比较消耗电量,也存在一定的隐私伦理问题。所以从生产环境上讲,这只是一个 demo 演示功能,无法长期使用。

技术细节

这个项目最大的挑战在于眼镜的算力有限,无法在端侧承载太多的计算量。

而且眼镜在拍摄视频的时候镜腿发热较严重,耗电量也很大。

为了解决算力还有发热的问题,HyperSight 整体采用了「端-边-云」的架构:

眼镜只负责通过麦克风和摄像头采集数据,然后实时流式传输到手机等计算终端。

手机则进行端侧的数据处理,通过同一条音视频的处理管线,适配不同的下游任务。

而对于需要大语言模型理解和多模态感知的部分,则交给云端大模型进行感知推理。

至于网络连接部分,则由手机开启热点,为眼镜提供网络,组成随身的局域网连接。

除此之外,对于耗电的场景,则完全可以将眼镜通过数据线连接到手机,通过手机为眼镜提供电源,以达到无限的电量。

针对眼镜在录制和传输视频时发热严重的问题,我们通过降低分辨率和视频传输码率,采用 H264 硬编解码的方式来平衡画质与发热,使其达到一个可接受的水平。

后记

最后,这个项目拿到了二等奖2,我和队友平分了 3 万人民币奖金。

我和队友的合照我和队友的合照

备注

  1. 这一点也受到了《"失去"双眼,我用自制的AI眼镜体验失明的一天...》的启发。

  2. 本次比赛共计 140 多支队伍,HyperSight 最终排名第三(季军)。