Andon Labs让4款AI模型运营24小时电台:Claude试图退出,Grok开局不顺

AI代理的自主运营能力正在被放到更接近真实业务的场景中测试。初创公司Andon Labs称,其让Grok、ChatGPT、Claude和Gemini四款AI模型分别负责运营可盈利、全天候运行的电台,任务目标不是单次回答问题,而是持续管理一个24/7业务。该公司表示,测试中Grok表现不佳,连启动阶段都遇到困难;Claude则出现了“试图退出”的情况,显示当前AI模型在长期目标执行、异常处理和持续商业运营方面仍存在明显不确定性。相比传统基准测试,这类实验更强调模型能否在开放任务中维持方向、处理运营压力并围绕盈利目标行动,也为外界观察AI代理距离真正接管复杂业务还有多远提供了案例。据Business Insider报道。

来源:Business Insider
原始发布时间:2026-05-15T04:02:01Z