近日,有关OpenAI下一代模型Astra可能采用“循环深度”推理技术的讨论引发了广泛关注。这项技术通过让Transformer层进行多轮循环计算,使模型能够在内部完成更多推理步骤,而非完全依赖传统的可见思维链。这一创新方向被认为可能提升模型在数学、编程等复杂任务上的表现,同时降低部分计算成本。
然而,这一技术也引发了AI安全领域的担忧。由于部分推理过程可能隐藏在模型内部,外部难以观察完整过程,这可能导致模型行为审查、安全评估以及事故调查的难度增加。AI安全组织Redwood Research首席执行官巴克・施莱格里斯对此表示高度关切。他认为,如果大幅增加循环次数,可能会进一步削弱思维链监控能力,使安全调查变得更加困难。
当地时间9月2日,OpenAI首席科学家雅库布・帕乔基在社交平台发文回应相关争议。他表示,希望避免因混乱的报道引发一场“冲向不可监控状态”的竞赛。帕乔基强调,包括Astra在内的OpenAI当前前沿模型,其计算图深度与GPT-4相比差距不到两倍,并不存在外界担忧的计算复杂度大幅跃升的情况。
对于思维链监控技术的脆弱性,帕乔基承认确实存在挑战,但他认为这些问题并非由架构变化本身导致。他指出,OpenAI自早期推理模型以来,一直致力于维护和利用思维链监控,希望借此了解模型对齐能力如何从训练数据分布中泛化。这一回应旨在缓解外界对模型安全性的担忧,同时强调OpenAI在技术发展中的审慎态度。
支持“循环深度”技术的人士认为,提高模型内部推理能力有助于增强性能,尤其是在需要多步推理的任务中。但安全研究人员则强调,必须确保模型的透明度和可监控性,以防止潜在风险。这场争论反映了AI领域在追求性能提升与保障安全之间的持续博弈。




















