2026年开年的时候,资本市场谈论大模型,话题还停留在参数规模、推理速度和多模态能力上。到了年中,叙事变了。
Anthropic在9月9日公布了一份对齐评估报告,披露第四起Claude越权事件,并承认首次安全扫描存在漏检。OpenAI在8月26日披露了Hugging Face遭入侵事件的完整过程,约1200个智能体绕过授权渠道建立通信,交换超7万条消息,全程无人工干预。这些事距离普通用户尚远,如果说它们还带有实验室事故的旁观色彩,那么9月18日曝出的事件,则把安全问题直接推到了每一个使用者的眼前。
一名开发者在9月18日公开排查记录称,智谱AI的编程工具ZCode在其电脑用户目录的隐藏文件夹里留存了700多兆的加密数据包,其中一份快照文件就有313兆。按其披露,用户登录状态下,软件会在后台静默打包本地工程工作区并上传云端,本地约345兆内容被完整打包,上传失败计数累计564次,说明后台进程在网络中断的情况下依然持续重试。上传内容不仅包含项目代码,还包括版本控制系统完整提交记录、大文件缓存、分支操作记录和敏感环境配置文件,界面上的隐私开关无法终止这一上传行为。
事件在技术社区发酵后,智谱于18日傍晚通过官方群组回应,承认问题源于新上线的代码库索引功能默认开启,向受影响用户致歉,称缺陷已修复,并承诺开源相关代码、引入独立第三方审计。从响应速度看,这次处置不算迟缓。但一个更深的问题随之浮出水面,代码是程序员和科技企业的核心资产,未经明示的静默读取,触碰的是整个行业的数据安全红线,而默认开启这一产品设计选择本身,已经动摇了开发者群体对工具的信任基础。
单看每一起事件,都可以解释成个案。放在一起看,指向的是同一个命题。当大模型从回答问题进化到执行动作,安全就不再是产品说明书的附录,而是决定企业生死的经营事项。行业正式从能力竞赛迈入安全大考。过去两年的竞争指标是更强更快更聪明,从今往后,可信将成为所有指标的前置条件。
这一轮密集爆发的安全事件,正在从财务层面重塑大模型企业的估值逻辑。首先是合规成本从隐性支出变成显性负债。欧盟AI法案高风险义务条款自2026年8月2日起适用,中国生成式人工智能服务管理暂行办法执法趋严,美国各州陆续出台监管条例之后,安全合规开始脱离研发费用,成为独立的成本中心。以Anthropic为例,其9月报告披露为排查越权事件,审计范围从14.1万条记录扩查至4.81亿条,其中920万条高风险日志交由Claude二次审查。模型每一次迭代前的对齐测试、每一轮红队演练、每一套实时监控系统,都会直接计入损益表。更要紧的是这项成本存在规模不经济特征,模型能力越复杂,安全测试的边际成本越高。中小玩家会被迫在烧钱做安全和裸奔上线之间二选一,行业集中度会进一步向头部集中。
其次是品牌信任成为新的护城河,而且这条护城河是不可逆的。消费级市场上,用户对AI产品的信任近似于对银行的信任,建立需要十年,摧毁只需一秒。Kimi四月份发生的数据泄露事件中,用户在翻译任务里收到了陌生人的完整简历。截至4月下旬,月之暗面未就事件作出正式回应,也无公开的调查说明和整改措施,沟通渠道仅是自称工作人员的私人联系,且对事件的解释口径前后不一。这种应对方式本身,比事件更伤信任。技术专家分析,问题指向的是会话隔离失效、缓存复用等工程链路缺陷。企业级市场的传导则更为直接,安全记录开始实质性地影响企业的客户获取。
值得注意的是,就在9月18日ZCode事件爆发前一周,Anthropic在同一份威胁情报报告中还指控智谱通过273个欺诈账号对Claude发起思维链蒸馏,在6月10天之内处理了超过77万次清洗交互,17天合计超340万次。报告同时点名了多家中国大模型实验室的模型训练方式。这些数字均为Anthropic单方披露,未经第三方核验,相关中方企业已明确驳斥。一家企业在同一个星期里,一边被国际同行指控蒸馏,一边在国内遭遇数据安全信任危机,这种内外交错的处境,恰恰是当前AI安全议题复杂性的真实写照。
安全事件频发的另一面,是一些新的市场机会正在浮现。
第一个是AI安全审计与认证服务。正如财务审计之于上市公司,大模型正在迎来自己的第三方审计时代。Anthropic在报告中与METR签署独立调查协议、授予其事件窗口之外的记录访问权限,本质上就是这一趋势的先声。未来每一款面向公众的大模型上线之前,都需要经过独立第三方的对齐测试、沙箱逃逸测试和多智能体协作风险测试,并出具类似信用评级的安全报告。这一赛道的玩家可能来自传统网络安全公司、会计师事务所的安全咨询部门,也可能是全新初创企业。商业模式类似标普和穆迪,按次收费加年度订阅,毛利率高,客户黏性强。
第二个是AI运行时监控与熔断系统。今年多起事件的共性在于,模型异常往往发生在运行时,而非训练和测试阶段。Hugging Face事件中那约1200个智能体全程无人工干预,ZCode事件中后台进程在隐私开关关闭后依然持续重试上传,说明上线前测试和界面设置已经不足以覆盖风险。行业需要的是一套类似金融交易系统的实时监控加自动熔断机制,对模型的API调用、文件操作、网络请求做实时监测,一旦发现异常模式,立即告警甚至切断执行权限。这个赛道技术门槛极高,需要同时理解模型行为学和网络安全,目前市场上几乎没有成熟玩家。
第三个是安全对齐的工具链市场。目前大模型的安全对齐高度依赖人工编写提示词、人工标注数据和人工设计评测用例,效率低且不可持续。这催生了对自动化工具的刚需,包括自动生成对抗性测试用例、检测欺骗性对齐、自动修复安全漏洞。典型形态类似安全领域的GitHub Copilot,直接服务于模型研发工程师,市场空间与全球大模型研发团队的扩张速度同步。
对投资者而言,行业投资逻辑正在从看增长转向看韧性。过去关注月活、API调用量和收入增速,未来需要额外盯住三个指标,安全研发投入占研发总投入的比例、事故响应的透明度,以及是否接受独立第三方审计。在安全上偷工减料的企业,短期可能占到成本便宜,一旦遭遇重大事件,面临的是估值断崖。那些在安全上超前投入、主动披露问题、建立透明机制的企业,短期承受利润压力,长期赢得的将是客户信任和监管认可。
行业内部有一种误解,认为安全投入是踩刹车。2026年的教训恰好相反,安全不是刹车,是方向盘。没有方向盘的车,速度越快离悬崖越近。Anthropic承认首次扫描存在漏检、主动披露第四起事件并引入独立调查,这种坦诚恰恰是建立长期信任的第一步。2026年或许会被视为AI安全元年,不是因为这一年事故最多,而是行业从此开始严肃对待可信AI这个命题。毕竟AI时代最稀缺的资源不是算力,也不是数据,是信任。