你家的 Wi-Fi 路由器,能看见你吗?
Wi-Fi 感知能在实验室重建人体骨架,但从论文到家用路由器隔着三道物理约束。学术是真的,落地还很远。
2026 年 5 月,一个名叫 RuView 的 GitHub 项目冲上了全球热榜,star 数突破 55,000。它的卖点听起来像科幻:用两个不到 10 美元的 ESP32 芯片,加上你家里那台普通 Wi-Fi 路由器,就能隔着墙看见人的骨架、监测呼吸和心跳,全程不用一颗摄像头像素。
几乎在同一时间,Hacker News 上出现了一个讨论帖,标题是:「热门项目宣称能用 Wi-Fi 检测移动,但没人能跑起来。」
同一件事,有两个截然相反的答案。这个落差本身,就是今天值得讲的故事。因为「Wi-Fi 能不能看见你」这个问题,确实有一个真实的、可核实的答案——只不过它取决于你在什么条件下问。
学术上,它真的做到了
先说真的部分。
2023 年初,卡内基梅隆大学(CMU)发表了一篇论文,标题直白得有点吓人:《DensePose From WiFi》。研究者用 Wi-Fi 信号,重建出了画面里每个人的人体姿态——不是模糊的热点,而是对标摄像头视觉方案的密集姿态估计。
它怎么做到的?关键在一个叫 信道状态信息(Channel State Information,简称 CSI)的东西。当 Wi-Fi 信号从发射端走到接收端,它会经过墙壁、家具、还有你的身体,一路上不断反射、绕射。CSI 记录的就是这条路径上每个子载波的振幅和相位变化。人一动,多径传播的「指纹」就变了。换句话说,你的身体在无形中改写了空气里的电波,而 CSI 把这个改写记录了下来。
CMU 的装置是这样的:两台标准 Wi-Fi 路由器,一台发射、一台接收,每台 3 根天线,组成 3×3 共 9 对天线链路,从 56 个子载波里以每秒 100 帧的速度采集 CSI,再喂给一个深度学习模型。
效果如何?这里需要精确,不能含糊。论文报告的主要指标是 AP@50 = 87——在 IOU 阈值放宽到 50% 时,精度确实接近当时的摄像头视觉基线。这是「媲美摄像头」这个说法的全部出处。
但同一张表里还有另外两个数字:AP@75 只有 44,总体 mAP 是 43。当把精度要求收紧到 75%,差距立刻显现。论文作者自己写了一句很诚实的注脚:「相对较低的 AP@75 值表明,人体的细节并未被完美估计。」
翻译过来就是:Wi-Fi 能看出「这里站着一个人,他大概是这个姿势」,但要它精确还原手指的位置,目前还做不到。
三道物理约束
如果 CMU 已经证明可行,为什么 RuView 这类「家用版」跑不起来?
因为从那间实验室到你家客厅,隔着三道不是靠改算法就能绕过的物理约束。
第一道:大多数路由器根本不给你 CSI。 你家路由器随手能读到的,是 RSSI(Received Signal Strength Indicator,接收信号强度指示)——一个单一数值,告诉你信号「强不强」。而感知需要的是 CSI,一个包含每个子载波振幅和相位的完整矩阵。绝大多数消费级路由器固件封闭,根本不导出底层 CSI。要拿到它,得用特定芯片刷专用固件(比如基于 Broadcom 芯片的 Nexmon CSI),或者改用 ESP32 这类开发板。RSSI 和 CSI 的差距,就像「知道屋里有人在说话」和「听清每个字」之间的差距。
第二道:换个房间就失灵。 这是最致命的一道。CMU 论文自己的数据:在同一个房间布局下训练和测试,AP 是 43.5;换到一个没训练过的房间布局,AP 跌到 27.3——下降约 37%。另一个指标 dpAP·GPS 降幅达到 44%。论文原话是:「不同环境中的 Wi-Fi 信号呈现出显著不同的传播模式,这使得把模型部署到未经训练的布局上成为一个极具挑战性的问题。」更广泛的研究显示,Wi-Fi 姿态模型换环境后普遍损失 40% 到 70% 的精度,哪怕只是在同一栋楼里换个房间。原因前面说过:CSI 是房间的多径指纹,和你的动作特征深度耦合。模型学到的,有一大半其实是那个特定房间的样子。
第三道:天线不够,空间信息回不来。 CMU 用的是 3 发 3 收的 MIMO 配置,靠多对天线链路从不同角度「看」同一个场景,才能重建空间。而原版 ESP32 只有一根天线,是单发单收(SISO),物理上就缺少重建空间所需的角度分集。一篇研究低成本 Wi-Fi 感知的论文(ESPARGOS)说得很直接:「廉价 ESP32 的主要劣势是 MIMO 信道数太少,通常只有三根或更少天线,这对严重依赖空间分集的感知应用很不利。」少了的那几只眼睛,不是软件能补回来的。
回到 RuView:让数字说话
理解了这三道约束,再回头看 RuView 的代码,就清楚了。这里不做价值评判,只看可核实的事实。
它的核心宣称是「17 关键点人体骨架输出」,对标的正是 CMU 那篇论文。但项目自己的架构文档 ADR-079 显示:这套 17 关键点姿态估计的训练管线,状态是 Pending(未完成)。仓库不附带任何预训练权重。换句话说,当没有加载模型文件时,屏幕上那个动来动去的骨架,是用信号幅度的方差和运动频带功率直接驱动的一个占位显示,而不是从学习到的关键点推断出来的。
GitHub 上的 Issue #299 是个具体注脚:一位用户接了两个 ESP32 节点,WebSocket 连接正常,能读到心率和呼吸率的数值——但「未检测到人体运动,未生成骨架模型」。信号确实进来了,骨架确实没出来。
那个被反复引用的「82.3%」呢?它是真实的数字,但含义被误读了。它是 temporal-triplet accuracy,即时序三元组嵌入的质量指标,在「一个房间、一次采集、两个节点」的条件下得到的 embedding 质量分数,而不是通常意义上的姿态识别准确率。至于早期文档里那个更醒目的「100% 存在检测」,项目方后来自己撤回了。
可以工作的功能是有的:存在检测、运动分类、有限条件下的呼吸率和心率。这些本身有价值。落差在于,宣称的那一层——穿墙看骨架——和实现的那一层之间,正好横着前面那三道物理约束。
方向是真的,时间还早
把镜头拉远,会发现学术界和产业界并不认为这个方向是空中楼阁。
2024 年 10 月,IEEE 802.11bf 标准正式冻结。这是 Wi-Fi 协议第一次把「感知」写进正式协议层——它规定了 WLAN 感知的帧结构和信令机制,让获取 CSI 这件事第一次有了标准接口。注意它规定了什么、又没规定什么:它给出框架,但把具体的感知算法留给厂商。也就是说,802.11bf 不是一个「刷新固件就能穿墙看人」的开关,它只是把地基铺好了。整个产业愿意为这块地基立一套标准,本身就是一个信号——它们认为这个方向是真实的未来,值得现在就为它铺路。
在资助层面,2026 年度日本未踏 IT 人材発掘・育成事業已将这个方向纳入实际立项:采择项目之一是苅山湊主导的「デバイスフリー・カメラレスで人物・動作を認識するWi-Fiセンシング基盤の開発」(无设备、无摄像头的人物与动作识别 Wi-Fi 感知基盘开发)。国家级工程人才孵化项目把钱投向这里,意味着在它们眼里,这不是噱头,是值得培养的工程能力。
但同样值得记住的是另一面:截至 2024 年初,MIT Technology Review 的结论是,市面上「还没有商业上可行的 Wi-Fi 呼吸监测或跌倒检测设备」。已经落地的产品,比如 Cognitive Systems 的 Aura,做的也只是区分人、宠物和机械的运动检测,而不是重建姿态。地基铺好了,楼还没盖起来。
所以,那道把实验室和你家路由器分开的鸿沟,缺的究竟是什么?
是 AI 这一环。跨环境泛化——让模型换个房间不至于失灵;少样本适应——不用在每个新场景重新采集成千上万帧训练数据;以及在 ESP32 这种受限硬件上做有效推理。这三件事,恰好都是机器学习正在攻坚、却还没真正攻克的方向。
CMU 的论文是真的,802.11bf 是真的,产业的押注也是真的。RuView 跑不出骨架,同样是真的。
这两件事并不矛盾。它只是说明:你家的 Wi-Fi 路由器,现在还看不见你——但我们已经清楚地知道,它卡在了哪里。