
近期,美国AI公司Anthropic指控中国三家大模型厂商DeepSeek、Kimi和MiniMax发起“蒸馏”攻击一事,在AI行业掀起轩然大波。这一事件不仅引发了关于技术伦理与商业规则的激烈讨论股票配资平台,更折射出国产大模型在算力、数据等资源受限背景下的发展困境与突围路径。
## “蒸馏”指控:技术伦理与商业规则的碰撞
Anthropic在公告中称,三家中国厂商通过虚假账户与代理服务大规模调用其Claude模型接口获取输出结果,用于优化自身模型能力。在AI领域,“蒸馏”本是一种常见训练方式,即用强模型输出去训练弱模型,利用商业模型生成合成数据提升性能也被部分从业者视为“公开的秘密”。但Anthropic在服务条款中明确禁止此类行为,认为大规模注册假账号“薅羊毛”违反商业契约,破坏公平竞争。
开发者社区对此看法不一。支持Anthropic者认为,这种行为违背商业道德;反对者则质疑Anthropic自身训练模型时也使用了互联网数据,未必都获得原作者授权。硅基流动联合创始人杨攀将模型厂商间的“蒸馏”行为类比为“偷师”,而埃隆·马斯克更直接嘲讽Claude“偷师”人类和其他模型。被点名的三家国产大模型公司尚未回应,事件真相仍待进一步澄清。
## 成本困局:资源差距下的无奈选择
在模型公司负责海外业务与技术开源的工程师李轩看来,Anthropic所谓的“蒸馏攻击”一词带有贬义,但他认为国产模型厂商并非技术能力差,而是受资源限制的无奈之举。海外厂商资金雄厚,可投入大量资源进行数据标注和模型训练。例如,为提升数学竞赛能力,海外厂商会针对一道错题衍生出100道相似题目进行标注,确保模型无死角覆盖,而国内高端数据标注人才稀缺,标注成本高昂,难以复制这种模式。
算力也是国产大模型面临的隐性瓶颈。目前,国内大模型训练主要依赖英伟达GPU,但受美国出口管制影响,高端芯片获取难度极大。国产大模型面临“有钱也买不到卡”的困境,训练阶段算力不足会限制模型规模,推理阶段算力不足会影响用户体验。MiniMax被指控向Claude模型发送的请求量超过1300万次,对应的API调用成本可能高达数亿元,而其从2023年至2025年前9个月账面亏损超12亿美元,资金压力可想而知。
## 突围路径:垂直场景与基础研究双发力
面对数据和算力的双重枷锁,线上炒股配资开户国产大模型厂商并非无计可施。在长期推动模型业务“出海”过程中,李轩发现海外模型在中文理解和文化适配方面存在不足,这为国产模型提供了机会。如今,模型间“蒸”不出高价值数据的情况逐渐显现,全球从业者若都选择“蒸馏”,AI进化或将陷入“近亲繁殖”循环。
在此背景下,国产大模型厂商开始探索新的发展路径。一方面,聚焦垂直场景,打造细分领域优势。与海外厂商追求全能型模型不同,国内厂商可专注于中文处理、政务服务、医疗健康等垂直领域,满足特定用户需求。例如,在医疗健康领域,国产模型可结合国内医疗数据和临床经验,开发出更符合国内医疗场景的模型,为医生和患者提供更精准的服务。
另一方面,加大基础研究投入,推动技术创新。李轩观察到,国内厂商在高效训练、小样本学习、多模态融合等领域已取得不少研究成果,甚至可以基于领先的国产模型架构进行二次创新,推出更高效的新模型。例如,KimiK2宣布完全开源且允许商用,其架构虽与DeepSeekV3基本一致,但这是团队在尝试多种结构变种后,基于成本和效果考虑做出的选择,也为国产模型的技术创新提供了新思路。
此次“蒸馏”争议为国产大模型行业敲响了警钟,也指明了发展方向。在资源受限的情况下,国产大模型厂商需摒弃盲目“偷师”的短视行为,聚焦垂直场景,加大基础研究投入,以技术创新为驱动,实现产业突围。只有这样,国产大模型才能在激烈的全球竞争中占据一席之地股票配资平台,推动AI技术向更高水平发展。
元鼎证券_元鼎证券app官方下载_线上炒股配资开户提示:本文来自互联网,不代表本网站观点。