出品|虎嗅科技组 作者|宋思杭 编辑|苗正卿 头图|视觉中国 9月18日,有开发者发现,智谱ZCode在默认开启"代码库索引"的情况下,会将用户工作区及完整Git历史打包上传至云端;智谱随后致歉,称相关功能用于生成Repo Wiki,上传数据会在页面生成后立即销毁。 但这件事情远没有智谱说得那么轻松,他不是一次简单的误操作,也并不是产品功能配置失误,这些都低估了它的严重性。 代码泄漏的第一责任人一定是智谱。因为在这背后的原理是,用户使用的是智谱提供的产品,客户端读取什么、上传什么,功能是否默认开启,用户能否拒绝,都由智谱决定。即使问题由某个开源组件、外包团队或者技术供应商引发,智谱也不能将责任转嫁给一段代码。 更严重的是,ZCode上传的不是用户主动提交给模型的一段代码,而是整个项目工作区和Git历史。Git历史中不只有当前源码,还可能包含未发布功能、被删除的文件、本地分支、提交者信息,以及开发者曾经误传、后来删除的密钥。对一家软件公司而言,这几乎相当于把研发过程、产品路线和内部资产一起交了出去。 也就是说,用户上传给模型的数据都被用来训练智谱自己的模型。这就相当于,如果有企业员工选择用智谱的Coding模型工作,那么这些公司的机密包括核心代码,在智谱模型里面都是透明的。 而用户在这之前甚至不知道数据已经离开本地。 这也是为什么,智谱称数据已经删除,并不足以结束争议。数据一旦上传,控制权就已经发生转移。它是否进入日志、缓存和备份,是否经过其他系统处理,是否被内部人员访问,乃至是否进入后续的数据清洗与模型训练流程,用户都无法从客户端验证。 虎嗅与业内人士交流后了解到,大模型训练数据大致有两类重要
发表评论