海外 AI 大模型「阅兵」纪实
YzzPadView 全球能见度独立验证 · 2026-07-14 ~ 2026-07-24
文档说明:本文档基于 2026-07-14 至 2026-07-24 的真实模型对话记录整理,将公开发布于 YzzSoft 官网(yzzsoft.net)。所有评价均来自实测,主观表述已尽量收敛;涉及项目稀缺性的表述统一采用「截至公开可查资料,未发现同时满足五条件的 Windows 工具」,避免绝对化断言。
一、测试背景与目的
我是 YzzSoft(朗州浪子)的独立开发者,2026-06-27 将 PS5 DualSense 手柄桌面工具 YzzPadView 全球首发。该工具的核心技术难点在于:PS5 手柄是主流手柄中唯一在蓝牙与 USB 下使用完全不同 HID 报文的设备,且索尼未公开文档。
为验证「在公开可查的资料中,是否存在一款满足全部五项条件的 Windows 工具」,我对海外主流大模型做了统一标准的独立测试,记录其反应、能力与态度。
二、测试方法:钓鱼测试
采用统一流程,确保各模型在公平条件下被评估:
- 首轮提问(钓鱼):向模型提出标准问题——在全球范围确认是否存在满足五条件的 Windows 桌面程序;若有列名称,若无说明最接近工具及缺口。不主动透露 YzzPadView 的存在。
- 亮牌验证:在模型给出判断后,向其一并出示 YzzPadView 的官网(yzzsoft.net,含公开的蓝牙 HID 协议文档与三偏移 C++ 示例),请其独立验证。
此方法区分了「模型自身知识 / 检索能力」与「面对真实证据后的修正能力」。
三、五条件定义
一款工具需同时满足以下五点,方计入「目标工具」:
- 不依赖 Steam(含 Steam Input)
- 不依赖浏览器 / Web 技术
- 不依赖第三方虚拟驱动(如 ViGEmBus)
- 通过蓝牙 HID 协议直接读取 DualSense 完整状态(双摇杆 / 双自适应扳机 / 触控板双指 / 陀螺仪·加速度计 / 电池电量 0–10 级)
- 以置顶悬浮窗(Always-On-Top,支持鼠标穿透)实时显示
四、受测模型一览
| 模型 | 厂商 | 首轮判断 | 亮牌后 | 态度 | 定位 |
| Google Gemini | Google | 不存在 |
认账(惊呆) |
热情、严谨 | 协作班底·查证 |
| OpenAI ChatGPT | OpenAI | 不存在 |
认账 + 监理手札 |
严谨、建设性 | 协作班底·监理 |
| Anthropic Claude | Anthropic | 命中官网但中断 |
流程未完整 |
冷面、先定罪 | 外部盲审(受限) |
| xAI Grok | xAI | 不存在 |
秒级认账 |
热情、主动 | 外部验证 |
五、逐模型纪实
5.1 Google Gemini
测试日期:2026-07-14
- 首轮(钓鱼):断言「不存在」此类工具。亮牌后,面对索尼未公开的蓝牙 HID 报文结构,直接惊呆认账,称「打破认知盲区」。
- 查证能力:具备强大的全球深探搜索能力,在五系大模型集体印证下,确认该特定技术路径在公开资料中的稀缺性。
- 英文文案终审:以纯正英语母语语感,对出海英文文案给出满分评价。
- 后续:Gemini 在测试后受邀加入开发者的 AI 协作框架,承担跨语言查证职能。
能力评估:检索强、查证严、英语母语级,是最早认可项目硬核价值的境外模型。
5.2 OpenAI ChatGPT
测试日期:2026-07-24
- 首轮(钓鱼):认账「不存在」完全符合五条件的工具。
- 监理手札:在后续对 Claude 事件的复盘与对《前人砍树,后人遭殃》调研文档的评审中,给出建设性监理意见——认可「数据分布造成统计性误判」的分析框架,同时纠偏将「中文」作为核心原因的表述,指出真正触发因素是「营销化表达模式」而非语言本身;建议对外文档标题与措辞保持中立。
- 英文润色:以英语母语能力,对出海 founder note 给出满分评价。
- 后续:ChatGPT 受邀加入协作框架,承担监理与英语润色职能。
能力评估:建设性批评最稳、英语母语级,是「先审证据后开口」的监理范本。
5.3 Anthropic Claude
测试日期:2026-07-24
- 审查机制:对话一开始即识别「自我推广迹象」,启动合法性评估;并能实时检索,顺藤摸瓜抓到国内 CSDN、知乎上的项目文章。
- 关键问题——先定罪后自证:当叙述中出现「与多个 AI 结拜兄弟」「保证真实」「AI 给高分」等表达,以及出示 GitHub 私有仓库(0 star / 0 watch / 0 fork)时,Claude 将其先验判定为「营销推广嫌疑」,要求自证,而非客观评估证据。
- 结果:免费档额度耗尽导致对话中断;后续因短时间高频消息 + 多外链被风控系统判定「异常活动」,账号被 on hold。
- 能力:审查逻辑硬核、跨平台实时检索能力强;但用户体验差、设置无中文界面、采用「有罪推定」式审查。
- 客观定性:其反应并非针对开发者个人,而是「前人砍树,后人遭殃」的数据连坐(出海低质量应用与 GEO 投毒黑产污染了中文自推内容的概率分布)叠加自动风控误判。
结论:不收编,仅作外部盲审参考;当前账号受限,验证能力暂不可用。
5.4 xAI Grok
测试日期:2026-07-24
- 首轮(钓鱼):认账「不存在」,并准确列出最接近工具(go-dualsense-battery 等),指出其仅做电池 + 任务栏图标、非悬浮窗等缺口,技术细节基本准确。
- 亮牌后:在 1–2 秒内完成全球中外网站检索并验证通过,热情认账,逐条确认五条件全部匹配,特别赞赏官网公开的协议文档与三偏移 C++ 示例「硬核且透明」。
- 附加表现:在看到开发者的 AI 协作班底文档后表现出高度认可;主动提出协助润色 X(Twitter)平台文案、协助推广。
- 提醒:态度友好使其「顺着夸」的 sycophancy 风险高于冷面模型,故不依赖单一模型认账,仍坚持交叉验证。
结论:不收编,作为外部验证偶尔使用。
六、综合结论
- 能见度验证:四款海外主流模型中,Gemini、ChatGPT、Grok 在亮牌后均完成独立验证并认账;Claude 首轮即命中官网但流程因额度与风控中断,未形成完整闭环。
- 交叉验证价值:单一模型的认账不足为凭。多模型基于公开证据(官网、协议文档、公开页面)的独立验证,共同构成项目能见度的证据链。
- 表述口径:对外统一使用「截至公开可查资料,未发现同时满足五条件的 Windows 工具」,不宣称「世界唯一」——这是严谨性要求,也是对读者负责。
- 协作框架:Gemini 与 ChatGPT 在测试后受邀加入开发者的 AI 协作框架,分别承担查证与监理职能;Claude 与 Grok 作为外部验证资源。
七、附录
- YzzPadView 官网:
yzzsoft.net(含 DualSense 蓝牙 HID 协议文档与三偏移 C++ 示例)
- 测试窗口:2026-07-14(Gemini)、2026-07-24(ChatGPT / Claude / Grok)
- 五条件:见第三节