法证先锋3
深度|四张榜单,四种真相:WAIC 之后,世界模型到底该看哪个排名?_我的网站

一 | 12·29 제주항공 여객기 참사 장소인 전남광주 무안국제공항의 콘크리트 둔덕. 연합뉴스12·29 여객기 참사 직후 국토교통부 소속 공무원 7명이 무안국제공항의 방위각시설물(로컬라이저)가 관련 규정에 어긋나게 설치된 사실을 알고도 적법하게 설치됐다는 내용의 자료를 작성·배포한 혐의로 검찰에 넘겨졌다.26일 경찰청 국가수사본부 12·29 여객기 참사 특별수사단은 허위공문서 작성 및 행사 혐의로 국토부 공무원 7명을 전날 송치했다고 밝혔다. 보도참고자료 작성·검토자 4명과 고위직을 포함한 총괄 책임자 3명이다.이들은 참사 다음 날인 2024년 12월 30일과 31일 무안공항에 설치된 로컬라이저가 국내외 규정에 맞지 않는다는 사실을 알면서도 ‘무안공항의 로컬라이저는 관련 규정에 맞게 설치됐다’는 내용의 보도참고자료를 두 차례 작성해 국토부 출입기자단에 배포한 혐의를 받는다.앞서 29일 제주항공 7C2216편 여객기는 무안공항에서 동체 착륙한 뒤 활주로를 이탈해 로컬라이저가 설치된 철근 콘크리트 소재 둔덕을 들이받고 폭발했다. 이 사고로 탑승자 181명 가운데 179명이 숨졌다.경찰은 국토부가 사고 여객기가 충돌한 로컬라이저의 문제점을 지적하는 언론 보도가 잇따르자 불리한 규정은 빼고 국토부에 유리한 규정만 선별적으로 인용·해석해 자료를 작성했다고 판단했다.관련 규정은 활주로 종단안전구역 등에 설치되는 항행시설을 항공기 충돌 시 부러지기 쉬운 재질과 구조로 설치하도록 정하고 있다.활주로 끝단에서 300m 이내에 설치된 구조물이 이런 요건을 충족하지 못하면 교체하거나 300m 밖으로 옮겨야 한다는 국제민간항공기구(ICAO) 지침도 있다.경찰 조사 결과 국토부 사고대책본부에서는 참사 다음 날인 12월 30일 해당 지침인 ‘ICAO 문서 9157’과 관련 규정을 전달받아 3시간 30분 넘게 회의한 것으로 파악됐다.회의에서는 로컬라이저가 규정에 맞지 않아 자료를 낼 때 신중해야 한다는 의견이 제시됐으나, 보도참고자료에는 반영되지 않은 것으로 조사됐다.자료 제목도 애초 ‘로컬라이저는 적법하게 설치됐다’는 내용으로 작성됐다가 회의 과정에서 ‘적법하게’라는 표현이 지나치게 강하다는 의견에 따라 ‘관련 규정에 맞게 설치됐다’로 변경된 것으로 확인됐다.한동훈 특별수사단 단장은 “회의에서 규정 위반 가능성을 지적하는 의견이 나왔지만 무시됐고 결국 국토부에 유리한 방향으로 자료가 배포됐다”며 “관련 규정을 장시간 검토하고도 불리한 내용만 누락한 점과 이후에도 자료를 바로잡지 않은 점 등 간접사실을 토대로 고의를 판단했다”고 설명했다.경찰은 국토부가 이후에도 책임을 피하기 위해 로컬라이저의 위법성에 관한 대응 논리를 지속해서 마련하는 등 문제점을 조직적으로 은폐한 정황을 확인했다고 설명했다.경찰이 한국공항공사 압수수색을 통해 확보한 국토부 문건에는 무안공항 부지 특성상 콘크리트 구조물의 불가피성을 검토하되 이를 확인하지 못하면 적절한 시기에 위법성을 인정한다는 취지의 내용도 담긴 것으로 전해졌다.이 문건은 지난해 1월 6일 오전 국토부에서 한국공항공사로 전달된 사실이 확인됐지만, 작성자와 내부 보고 범위 등은 밝혀지지 않았다.통상 주요 보도자료는 정부 차원의 협의도 거치지만, 당시 비상계엄 정국과 맞물린 상황에서 별도 회의는 열리지 않은 것으로 조사됐다.특별수사단은 지난 2월 국회 ‘12·29 여객기 참사 진상규명을 위한 국정조사특별위원회’에서 국토부의 사고 원인 축소·은폐 의혹이 제기되자 사실관계를 확인하는 과정에서 보도참고자료가 허위로 작성된 정황을 포착해 수사에 착수했다.경찰은 참사와 관련해 업무상과실치사상 혐의를 받는 67명을 입건하는 등 현재까지 74명을 수사했고, 신속한 처벌이 필요하다고 판단해 자료 배포와 관련한 7명을 우선 송치했다.특별수사단은 이르면 오는 10월, 늦어도 연말까지 자체적으로 판단할 수 있는 부분의 수사를 마치고 검찰과 협의할 방침이다. 다만 사고 원인에 관한 최종 수사 결과는 항공·철도사고조사위원회 조사 결과가 나온 이후 발표할 수 있다는 입장이다.。 7 月的上海,世博展览馆 H3 馆的过道比往年拥挤许多。 入口处停着宇树的载人变形机甲 GD01,观众排队坐进驾驶舱拍照。往里走,300 多台机器人真机散在 200 多家具身智能企业的展台之间,具身智能无疑是这届 WAIC 最具象的展品。而视频生成公司的展台就设在机器人公司隔壁,播放演示片的屏幕连成片:机械臂倒水,无人机穿林,虚拟角色转身。 不同公司的讲解员说着高度趋同的话:都在讲具身智能,都在讲世界模型。 图:WAIC 2026 现场,宇树科技展台(来源:新蓝网) 穿梭在展台之间的投资人,面对诸多公司同样问着高度趋同的一套问题,核心聚焦在模型到底什么水平。但得到的答案却分别指向不同的东西。有人打开手机展示 VBench 排名,有人调出 RoboTwin 2.0 的任务成功率曲线,有人谈仿真到真机的迁移数据。同一个词,在不同的展台上被不同的数字定义。 当具身智能与世界模型成为显学,榜单便不再只是技术社区的内部排名,而成了行业理解技术路线的入口,在某种程度上,更成了话语权本身。

二 | 一张拼图,三个榜单 2026 年以来,具身智能和世界模型几乎成了 AI 圈最热的两个词。

三 | 技术圈在讨论,视频模型到底能不能成为机器理解物理世界的路径。资本圈在讨论,下一代 AI 公司,能不能从“会说话的模型”走向“会理解、会预测、会行动的模型”。媒体圈的问题则更清晰、直白,当“世界模型公司”越来越多,到底该怎么看谁更强? 然而时至今日,世界模型依旧没有一个统一的定义和衡量标准。

四 | 落到具体的评测上,世界模型目前还不是一种单一分数就能概括的能力,它更像一张尚未完成的拼图:视频质量、指令理解、时序一致性、物理规律、机器人执行、动作预测,每一项能力背后都站着一张榜单和一群拥趸。 那么,具身智能和世界模型到底该看哪些榜单?把这张拼图拆开,有三块版图绕不开:一张回答"像不像",一张回答"懂不懂",一张回答"动不动得了"。看懂它们,比看懂任何一场发布会都更接近行业的真实进度。还有一块回答"准不准",它是整张拼图的底座,值得单独一章。 VBench:回答"像不像" VBench 是目前视频生成领域最常用的评测体系之一,由南洋理工大学 S-Lab、上海人工智能实验室 OpenGVLab 等机构推出。

五 | 它从主体一致性、背景一致性、运动流畅度、美学质量等 16 个维度评价生成视频。

六 | 它回答的问题很直接:模型生成的视频,像不像真实世界,是否符合用户输入。 在 VBench 1.0 认证榜中,头部模型集中在 84 分到 88 分之间,差距已经很小。于是 VBench 在 2025 年推出 2.0 版本,将评测范围扩展到人类保真、物理、可控性、常识等维度,开始关注那些决定真实感、却容易被忽略的问题。

七 | 根据其 HuggingFace 官方榜单的认证视图,主要名次如下: 图:VBench-2.0 榜单:Veo 3 以 66.72% 居首(来源:HuggingFace Vchitect/VBench_Leaderboard,2026 年 7 月截图) 但 VBench 仍主要评价视频结果。画面可以逼真,模型却未必理解画面背后的规律。 WorldModelBench:回答"懂不懂" 如果视频生成模型被称为“世界模型”,它就需要接受更严格的检验。 2025 年,来自 UC Berkeley、UC San Diego、NVIDIA 和 MIT 的研究者推出 WorldModelBench,把模型放进物理和常识环境中测试。 该评测覆盖机器人、驾驶、工业、人类活动等 7 大领域,包含 350 条提示词和 6.7 万条人工标注,从指令遵循、物理规律、常识三个维度打分。其中物理遵循占总分一半。原因很简单:世界模型最重要的能力之一,是预测物体在真实世界中会如何变化。 结果显示,即使表现最好的模型,也只有 61% 的视频正确完成指令;12% 的视频违反质量守恒,11% 出现物体互相穿透。

八 | 模型能生成一个看起来合理的世界,但距离真正理解世界,还有明显距离。 图:WorldModelBench 官网榜单(来源:worldmodelbench-team.github.io,2026 年 7 月截图) RoboTwin 2.0:回答"动不动得了" 世界模型终究要服务于行动,再往拼图下游走一格,机器人能否干活便成了一个很重要的维度。 RoboTwin 2.0 由上海交大 ScaleLab 与港大 MMLab 主导、上海人工智能实验室参与。它包含 50 个双臂协同操作任务,抓取交接、工具使用、可形变物体操作,跑在 SAPIEN 仿真器上,支持 Aloha-AgileX、ARX-X5、Piper、Franka、UR5 共 5 种双臂本体,配套一个 731 个实例、147 个类别的物体库,通过 Easy 和 Hard 两种环境,测试机器人能否从仿真走向更复杂的真实世界。 早期结果显示,在 Hard 设定下,多数方法成功率仍低于 20%。

九 | 机器人能够完成特定任务,但距离稳定、泛化地完成任务还有很长距离。 图:RoboTwin 2.0 官方榜单(来源:robotwin-platform.github.io,2026 年 7 月截图) 三张榜单,三种能力,各自有发布机构和评分体系。没有一张榜单能独自定义世界模型,放在一起,他们才勾勒出一条从生成、理解到行动的能力链。

十 | 但这个链条还缺少一个最关键的环节。 Physics-IQ:回答"准不准" 人类做很多动作时,会下意识在脑中预演结果。推一下杯子,它会滑多远,会不会翻倒;倾斜水壶,水会从哪里流出来;把两块磁铁靠近,它们会吸住还是弹开。 机器人也需要这种能力。它必须根据眼前的状态,预测几秒后会发生什么,再决定下一步动作。视频世界模型经常在这里犯错。这类预测如果不准,后面的规划和执行都无从谈起。 测量这一底座能力的基准叫 Physics-IQ,由 Google DeepMind 与 INSAIT 联合推出,论文发表于 WACV 2026。 2026 年 6 月,原团队联合 Anates Labs 发布修正版 Physics-IQ Verified,修正了 57.6% 的样本标注问题,改用逐样本加权计分。

十一 | 它的设计与前述榜单都不同:研究者真实拍摄了 66 个物理实验,覆盖固体力学、流体、光学、热力学、磁学五大类,每个实验 3 个机位、实拍 2 次,共 396 段 8 秒视频。模型只看前 3 秒,预测后 5 秒会发生什么,再与真实拍到的后续画面比对。4 项指标合成一个 0 到 100 的 Physics-IQ 分数,并用同一场景两次实拍之间的差异做归一化:真实世界自己重拍一次都不会完全相同,模型的预测就被拿来和这种自然波动比较。 Physics-IQ 考察的是更底层的问题,即这个模型是否真的理解物理。这也正是图灵奖得主 Yann LeCun 多年来反复主张的观点,“AI 需要建立关于世界的内部模型,而不是只会生成内容”。他担任 Meta 首席科学家期间, Meta FAIR 便把 Physics-IQ 当作核心评测基准。 然而翻开 Physics-IQ 的官方榜单,排在第一的却并非 Meta 的模型,也不是英伟达投入重金的Cosmos,而是一个中国的视频生成模型。

十二 | 2025 年 4 月 21 日,Sand.ai 的 Magi-1 以 56.0% 的得分上榜登顶。当时的榜首、Google 的 VideoPoet 只有 29.5%,Magi-1 几乎把这个数字翻了一倍。从那天算起,Magi-1 系在第一名的位置上坐了约 13 个月,中间只离开过三周。 这张表有三种读法。

十三 | 看裸模型:前三名里有两个建立在 Magi-1 之上,Magi-1 的 56.0% 是 v2v 设定下的裸模型最高分,远高于 Sora 2 裸模型的 42.3%,Cosmos3-Super 裸模型的 59.7% 出自不同设定,两者不直接可比。 看增强系统:2026 年 5 月,英伟达最新发布的旗舰世界模型 Cosmos3-Super 加持 WMReward 后冲到 63.4%,短暂登顶约三周;6 月 17 日,基于 Magi-1 的增强系统以 64.5% 重回第一。 图:Physics-IQ 官方榜单:Magi-1 系居首,Sora 2 裸模型 42.3%(来源:physics-iq.github.io,2026 年 7 月截图) 再看修正后的新榜:2026 年 6 月发布的 Verified 版本上,Magi-1 24B 增强版 58.2 分排第一、裸模型 48.4 分排第二,Cosmos3-Super i2v 39.5 分,Sora 2 只有 26.5 分。 图:Physics-IQ Verified 修正榜(来源:physics-iq-verified.anates.ai,2026 年 7 月截图) 把两张榜单放在一起看,会出现一个反常识的画面。OpenAI 的 Sora 在 VBench 这类回答"像不像"的榜单上名次并不难看,到了 Physics-IQ 上,Sora 2 裸模型只有 42.3%,不足榜首 64.5% 的三分之二;Verified 新榜上只有 26.5 分,不及榜首 58.2 分的一半。

十四 | 生成得逼真,和预测得准确,被证明是两回事。 把视频生成做成"预测下一个词" Magi-1 赢在哪里?论文给出的答案是架构选择。 当下主流的视频生成模型,Sora、Kling 等,走的都是扩散路线:一次性生成整段视频,所有帧同时去噪,彼此之间没有严格的时间先后。 而Magi-1 的做法更像语言模型预测下一个词:按时间顺序逐块生成,每块 24 帧,块内部用扩散去噪保证画质,块与块之间自回归衔接。通过 block-causal attention,后来的帧不会影响过去的帧,过去一旦被写下,就不再被影响。

十五 | 图:Magi-1 逐块自回归生成与块因果注意力示意(来源:SandAI-org/MAGI-1,arXiv:2505.13211) 这个架构天然更接近世界模型该做的事:根据世界的此刻,推演下一秒。它还带来几个工程上的特征:支持流式生成,视频可以边生成边播放;理论上可以无限长地续写下去。对世界模型而言,这意味着推演的时间跨度不受窗口限制,仿真可以一直进行,还可以逐块更换提示词,控制后续走向。 如果把关键词从“生成”换成“预测”,Magi-1 和 LeCun 主张的 JEPA 路线便有了一种理念上的深层呼应。LeCun 在 2022 年发表立场论文《A Path Towards Autonomous Machine Intelligence》,提出 JEPA 架构:不在像素空间预测世界,而在表征空间预测,主动忽略那些不可预测的细节。这条路线后来长成一个家族:I-JEPA、V-JEPA,再到 2025 年的 V-JEPA 2,用百万小时视频训练,其衍生版本可以做零样本的机器人规划。 图:Yann LeCun 在 2026 年 6 月巴黎 VivaTech 演讲(来源:La Ecuación Digital) 一个在像素世界里逐块自回归,一个在表征空间里做预测,虽技术方案完全不同,但都指向同一个判断,即能够预测物理世界变化是世界模型的必要条件。 尺子一旦出现,叙事便有了边界 在WAIC 的论坛上,"世界模型"被反复提起。7 月 19 日的一场人形机器人与具身智能论坛,主题之一正是"标准体系不统一"。开幕当天有观察文章写道:通用世界模型正在成为人形机器人的新竞争壁垒。 竞争的坐标系确实在平移。

十六 | 过去几年,视频模型的发布会比的是"像不像":分辨率、时长、美学分。Physics-IQ 这类榜单的出现,把问题换成了"物理世界变化预测的准不准"。它的价值不在于新添了一张榜单,而在于把世界模型从一个抽象概念,拉回到具象的物理世界:杯子会怎么倒,水会怎么流,光会怎么折。

十七 | 这些东西没法靠话术修饰。坐标系的变化不会写在任何一场发布会的邀请函上,但它会决定下一年资本流向哪里、人才流向哪里。 榜单会迭代,名次会更替。

十八 | 但标准一旦确立,理解行业的方式必然会被改写,模糊的叙事也就有了相对清晰的边界。

十九 | 尺子一旦有了,量出什么,就是什么。
Current article:http://www.zongchaeiwengshuabaisisuofu.sbs/list_tn7p/7chtcd.docx
Published on:15:07:57
相关新闻
- 刘德华发声,力挺古天乐
- 智能眼镜厂商奇点临近完成亿元天使轮融资_满足用户_底层
- 超六成规上工业增长来自新兴产业 读懂萧山的“四个始终没有变”
- 末节拼到6犯离场,北控男篮外援里勒18中10空砍27分4板7助
- China, Tanzania deepen financial cooperation through wider RMB use
- 扣篮界的黑八!陈登星凭借飞人臀下换手坐扣 淘汰NBA扣篮王麦克朗
- Robots take on new roles in Beijing's restaurants and nursing homes
- 联想发布了其首款瑜伽集成产品:一款27英寸触摸屏,底座带有无线充电功能
- 남부권 최대 10% 인하…전국 단일 산업용 전기요금 손질
- 打好引育服务“主动牌” 当好助企发展“暖心人”
最后更新
- 郑钦文终结单打三连败,时隔14个月大满贯赢球,晋级美网资格赛第二轮,赛后采访:恭喜自己,这几个月网球感觉不理想,需要找回状态
- 探索“住创一体”运营模式 才景和府入选省级青年安居试点
- US lifts TikTok federal-device ban, highlighting platform’s enduring US appeal: expert
- 华泰期货:合成橡胶下游需求依然没有亮点,供需改善有限
- 每天800元雇人“无限续杯”!男子狂薅车企40万羊毛,车企无奈报案;检方定性:诈骗罪
- 中国人民银行新增8家数字人民币业务运营机构
- 全市欧美同学会工作交流活动举行 为浙西片区创新创业共谋良策
- 罗马诺:摩纳哥有意签热刺中场萨尔,双方目前正在谈判
- 更强大!谷歌FI运营商服务推出下一代短消息功能rcs
- 第4人!哈登生涯总薪资达到5.11亿 前3位是詹库杜
热门新闻
- 辽宁省总工会发布23项暖“新”清单
- 著名的英国数学家阿泰亚去世后声称证明了黎曼猜想。
- 工信部通报26款APP及SDK存在侵害用户权益行为
- 短时暴雨和7~9级雷雨大风!杭州发布橙色预警!雨水这天开始减弱
- 马斯克:特斯拉完全自动驾驶今年无法获批
- Immersive heritage shows draw visitors to Tianmen Mountain in Hunan
- China’s ancient oracle bones reveal earliest written record of meteor shower 3,000 years ago
- 【观点】光大期货:白糖国内盘面总体表现偏弱
- Australia, Vietnam expand cooperation during To Lam visit; media’s China-targeting framing ignores Hanoi’s strategic autonomy: expert
- 不到半年,一人写下数百万行代码 22岁“跨界”青年“解锁”AI开源新赛道
