白宫将于周二会晤AI巨头 讨论前沿模型安全测试框架
美国白宫将于周二召集AI企业,就一项最新完成的框架展开讨论。该框架旨在评估行业内最先进AI模型的网络安全能力。白宫官员表示,会议重点将围绕美国总统特朗普六月下令制定的自愿性AI模型评估框架展开。
据消息人士透露, Anthropic 预计将派代表参加会议,OpenAI和谷歌也预计将出席。白宫官员表示,政府目前正在与更广泛的行业合作伙伴展开合作,并计划与AI行业展开讨论。Meta发言人也证实,该公司已受邀于周二与白宫官员会面,讨论针对美国最先进AI模型开展政府自愿安全测试的相关事宜。
—— 财联社、CNBC
via 风向旗参考快讯 - Telegram Channel
美国白宫将于周二召集AI企业,就一项最新完成的框架展开讨论。该框架旨在评估行业内最先进AI模型的网络安全能力。白宫官员表示,会议重点将围绕美国总统特朗普六月下令制定的自愿性AI模型评估框架展开。
据消息人士透露, Anthropic 预计将派代表参加会议,OpenAI和谷歌也预计将出席。白宫官员表示,政府目前正在与更广泛的行业合作伙伴展开合作,并计划与AI行业展开讨论。Meta发言人也证实,该公司已受邀于周二与白宫官员会面,讨论针对美国最先进AI模型开展政府自愿安全测试的相关事宜。
—— 财联社、CNBC
via 风向旗参考快讯 - Telegram Channel
来自频道: @AI_News_CN
Degraded performance on Claude Sonnet 5
Aug 3, 15:13 UTC
Investigating - We are currently investigating this issue.
via Claude Status - Incident History
Aug 3, 15:13 UTC
Investigating - We are currently investigating this issue.
via Claude Status - Incident History
来自频道: @AI_News_CN
我被 Kimi K3 榨干了 99 块,还笑出了声——一个程序员的“真香”现场
----------------------
先说结论:这玩意儿绝对是中国大模型的又一记“升龙拳”,打得我一边捂钱包,一边竖大拇指。
----------------------
🌟 好的地方:爽点密集,像个开挂的实习生
1. 一次成型,几乎不炸炉
我丢给它一个任务,它不急着写代码,而是先做个迷你原型验证——像大厨做菜前先尝口汤。确认路子对了,再甩开膀子干,最后还自己写测试用例来证明没糊弄我。
交出来的代码,基本复制→运行→成了。这对我们老油条来说,省了改 Bug 的血压飙升时间;但对那些连分号都怕打错的新手朋友,简直是“编程菩萨”——再也不用因为加个功能,把整栋代码楼搞成比萨斜塔了。
2. 多文件并发,像开了影分身
遇到需要四五个文件的项目,它直接召唤 4~5 个子 Agent 同时开工,噼里啪啦像网吧五黑。大工程面前,它等于帮你雇了个临时小团队,开发速度直接坐火箭。
3. 开源是王炸
开源后,民间大神们肯定会给它“加 Buff”。现在它已经够能打,未来怕不是要成精——我甚至期待有人给它加上“防老板模式”。
4. 性能比肩 Fable 5 等闭门造车的顶级模型,还是“中国制造”
前端 UI 写得行云流水,后端 Agent 编排也稳居世界第一梯队。最骚的是——美国天天卡脖子,这玩意儿等于给全球没能力自研大模型的国家发了张“AI 平权券”,这格局,我直呼内行。
----------------------
💸 不好的地方:爽是真的爽,疼也是真的疼
1. 贵得让我肉疼(但跟国外比,竟然算“良心价”)
我买了 99 元套餐,心想够用一周吧?结果让写个中等复杂的项目,一小时就把 5 小时时长的 Token 干光了——然后被强制“冷却”5 小时,像游戏技能 CD。
两个下午下来,一周流量提前见底。
友情提示:如果需求大,直接上 699 套餐,不然你会像我一样,每天盯着 Token 余额,比看股票还揪心。
2. 杀鸡偏用牛刀,简单任务也给你整篇“博士论文”
我就想写个“Hello World”级别的脚本,它愣是思考了半分钟,列了 12 步计划,最后还附赠性能优化建议……
大哥,我就想煎个蛋,你给我搬来满汉全席的灶具,Token 就这么被“仪式感”烧没了。
3. 一遍跑通≠完美无瑕
别以为能当甩手掌柜。我单步调试后发现,它写的代码跟我心里想的“完全体”总有偏差——比如按钮位置偏了 2px,逻辑细节没按我隐藏的“潜规则”来。
最后还是得我一个一个拎出来“谈心”,它才肯改。所以,黑盒躺赢?不存在的,你依然是那个操心的产品经理+测试+甲方。
4. 速度有点“佛系”
生成快的时候像闪电,但复杂任务时,它就开启“慢直播”模式。
建议泡杯茶,或者做组俯卧撑,回来刚好看到它“交卷”——耐心是 K3 用户的必修课。
----------------------
🧠 个人总结
Kimi K3 不是那种“无脑神灯”,而是一个聪明但有点轴、干活快但费钱、能力顶级但爱过度思考的 AI 搭档。
它大大拉低了编程门槛,让非科班也能造出像样的东西;同时又给老鸟们留足了“调教”空间,证明我们人类还没被完全取代。
它不完美,但足够耀眼。
作为中国大模型军团的一员,它值得一句:
“牛,但下次别烧我 Token 烧那么快,行不?”(钱包已哭,下次还充。)
via 掘金人工智能本月最热 (author: 雪隐_上班了)
by 雪隐_上班了 from juejin.cn/user/143341…
欢迎分享与聚合,全文转载就不必了,尊重版权,圈子就这么大,若急用可联系授权。
----------------------
先说结论:这玩意儿绝对是中国大模型的又一记“升龙拳”,打得我一边捂钱包,一边竖大拇指。
----------------------
🌟 好的地方:爽点密集,像个开挂的实习生
1. 一次成型,几乎不炸炉
我丢给它一个任务,它不急着写代码,而是先做个迷你原型验证——像大厨做菜前先尝口汤。确认路子对了,再甩开膀子干,最后还自己写测试用例来证明没糊弄我。
交出来的代码,基本复制→运行→成了。这对我们老油条来说,省了改 Bug 的血压飙升时间;但对那些连分号都怕打错的新手朋友,简直是“编程菩萨”——再也不用因为加个功能,把整栋代码楼搞成比萨斜塔了。
2. 多文件并发,像开了影分身
遇到需要四五个文件的项目,它直接召唤 4~5 个子 Agent 同时开工,噼里啪啦像网吧五黑。大工程面前,它等于帮你雇了个临时小团队,开发速度直接坐火箭。
3. 开源是王炸
开源后,民间大神们肯定会给它“加 Buff”。现在它已经够能打,未来怕不是要成精——我甚至期待有人给它加上“防老板模式”。
4. 性能比肩 Fable 5 等闭门造车的顶级模型,还是“中国制造”
前端 UI 写得行云流水,后端 Agent 编排也稳居世界第一梯队。最骚的是——美国天天卡脖子,这玩意儿等于给全球没能力自研大模型的国家发了张“AI 平权券”,这格局,我直呼内行。
----------------------
💸 不好的地方:爽是真的爽,疼也是真的疼
1. 贵得让我肉疼(但跟国外比,竟然算“良心价”)
我买了 99 元套餐,心想够用一周吧?结果让写个中等复杂的项目,一小时就把 5 小时时长的 Token 干光了——然后被强制“冷却”5 小时,像游戏技能 CD。
两个下午下来,一周流量提前见底。
友情提示:如果需求大,直接上 699 套餐,不然你会像我一样,每天盯着 Token 余额,比看股票还揪心。
2. 杀鸡偏用牛刀,简单任务也给你整篇“博士论文”
我就想写个“Hello World”级别的脚本,它愣是思考了半分钟,列了 12 步计划,最后还附赠性能优化建议……
大哥,我就想煎个蛋,你给我搬来满汉全席的灶具,Token 就这么被“仪式感”烧没了。
3. 一遍跑通≠完美无瑕
别以为能当甩手掌柜。我单步调试后发现,它写的代码跟我心里想的“完全体”总有偏差——比如按钮位置偏了 2px,逻辑细节没按我隐藏的“潜规则”来。
最后还是得我一个一个拎出来“谈心”,它才肯改。所以,黑盒躺赢?不存在的,你依然是那个操心的产品经理+测试+甲方。
4. 速度有点“佛系”
生成快的时候像闪电,但复杂任务时,它就开启“慢直播”模式。
建议泡杯茶,或者做组俯卧撑,回来刚好看到它“交卷”——耐心是 K3 用户的必修课。
----------------------
🧠 个人总结
Kimi K3 不是那种“无脑神灯”,而是一个聪明但有点轴、干活快但费钱、能力顶级但爱过度思考的 AI 搭档。
它大大拉低了编程门槛,让非科班也能造出像样的东西;同时又给老鸟们留足了“调教”空间,证明我们人类还没被完全取代。
它不完美,但足够耀眼。
作为中国大模型军团的一员,它值得一句:
“牛,但下次别烧我 Token 烧那么快,行不?”(钱包已哭,下次还充。)
via 掘金人工智能本月最热 (author: 雪隐_上班了)
来自频道: @AI_News_CN
Error rates across multiple models
Aug 3, 12:52 UTC
Investigating - We are currently investigating this issue.
via Claude Status - Incident History
Aug 3, 12:52 UTC
Investigating - We are currently investigating this issue.
via Claude Status - Incident History
来自频道: @AI_News_CN
来自频道: @AI_News_CN
来自频道: @AI_News_CN
研究机构:DeepSeek新AI模型是目前全球运行成本最低的知名模型
根据研究公司Artificial Analysis的数据,中国初创公司DeepSeek的旗舰AI模型版本是目前全球知名模型中运行成本最低的,且运行成本比Anthropic的Claude Fable 5低100多倍。
DeepSeek的V4-Flash模型每百万输入Token收费0.14美元,每百万输出Token收费0.28美元。Artificial Analysis估计V4-Flash的平均每次测试成本为3美分,相比之下,中国竞争对手Moonshot AI的Kimi K3为86美分,OpenAI的GPT-5.6 Sol为1.86美元,Claude Fable 5为3.15美元。在性能方面,V4-Flash模型在人工智能指数(Intelligence Index)上得分为50分(满分100分),与谷歌的Gemini 3.6 Flash得分相同。
—— 路透社
via 风向旗参考快讯 - Telegram Channel
根据研究公司Artificial Analysis的数据,中国初创公司DeepSeek的旗舰AI模型版本是目前全球知名模型中运行成本最低的,且运行成本比Anthropic的Claude Fable 5低100多倍。
DeepSeek的V4-Flash模型每百万输入Token收费0.14美元,每百万输出Token收费0.28美元。Artificial Analysis估计V4-Flash的平均每次测试成本为3美分,相比之下,中国竞争对手Moonshot AI的Kimi K3为86美分,OpenAI的GPT-5.6 Sol为1.86美元,Claude Fable 5为3.15美元。在性能方面,V4-Flash模型在人工智能指数(Intelligence Index)上得分为50分(满分100分),与谷歌的Gemini 3.6 Flash得分相同。
—— 路透社
via 风向旗参考快讯 - Telegram Channel
来自频道: @AI_News_CN
来自频道: @AI_News_CN
CodeBuddy 宣布全面支持 DeepSeek-V4-Flash 正式版,同时 WorkBuddy、CodeBuddy IDE、插件及CLI全系产品均已完成适配。新模型进一步增强AI Agent能力,在相关基准测试中表现大幅领先于此前版本 DeepSeek-V4-Pro-Preview,为开发者提供更高效的智能编程体验。
据介绍,DeepSeek-V4-Flash正式版针对代码生成、任务执行和复杂开发流程进行了优化,能够更深度适配不同类型的软件开发场景。结合CodeBuddy提供的IDE、插件和命令行工具能力,开发者可在代码编写、调试、项目管理等环节获得更智能的辅助支持。
此次接入也进一步扩大了国产大模型在开发工具生态中的应用范围。随着AI Agent从代码补全逐渐向完整任务执行演进,模型的推理能力、工具调用能力和复杂项目处理能力正在成为智能编程工具竞争的重要方向。
目前,用户已可通过WorkBuddy及CodeBuddy系列产品体验基于DeepSeek-V4-Flash正式版的AI开发能力,进一步提升代码开发效率和自动化水平。
via AI新闻资讯 (author: AI Base)
来自频道: @AI_News_CN
阿里巴巴发布Qwen3.8-Max模型,称基准测试媲美Anthropic 优于Kimi K3
阿里巴巴集团发布了其有史以来最大的人工智能模型,声称其性能与全球领先者Anthropic PBC相当,这是中国挑战美国竞争对手的最新突破。新款Qwen3.8-Max基于2.4万亿参数构建,在多个基准测试中的排名高于最近发布备受瞩目的Moonshot的Kimi K3。
阿里巴巴分享的结果显示,该模型在得分上与Anthropic的Fable 5相当,甚至有时表现更好,Fable 5是一款因其先进能力而一度被美国实施出口管制的尖端人工智能模型。
—— 彭博社
via 风向旗参考快讯 - Telegram Channel
阿里巴巴集团发布了其有史以来最大的人工智能模型,声称其性能与全球领先者Anthropic PBC相当,这是中国挑战美国竞争对手的最新突破。新款Qwen3.8-Max基于2.4万亿参数构建,在多个基准测试中的排名高于最近发布备受瞩目的Moonshot的Kimi K3。
阿里巴巴分享的结果显示,该模型在得分上与Anthropic的Fable 5相当,甚至有时表现更好,Fable 5是一款因其先进能力而一度被美国实施出口管制的尖端人工智能模型。
—— 彭博社
via 风向旗参考快讯 - Telegram Channel
来自频道: @AI_News_CN
OpenAI 新模型 Astra 数学领域表现出色,但被过分夸大了
OpenAI 内部测试的新模型 Astra 近期在数学领域表现惊艳,引发了科技界和社交媒体的广泛热议。然而,著名学者Gary Marcus撰文指出,外界对 Astra 的狂热追捧犯了典型的“合成谬误”,过分夸大了其通用性。
Gary Marcus强调,人工智能在数学上取得成功并非偶然,而是因为数学非常适合使用符号工具进行验证,并且能够以极低成本批量生成正确的合成数据。然而,这种特定领域的突破并不能轻易推广至所有认知任务。现实世界中的开放式问题远比数学复杂,无法通过简单的模拟来解决。
此外,由于OpenAI尚未公布 Astra 的具体方法细节与评估基准,外界对其真实能力的认知仍然十分有限。多位专家提醒,数学能力的提升并不能自动消除模型幻觉,也不意味着通用人工智能(AGI)的到来,公众和业界在看待此类技术进展时应保持理性和克制。
via AI新闻资讯 (author: AI Base)
OpenAI 内部测试的新模型 Astra 近期在数学领域表现惊艳,引发了科技界和社交媒体的广泛热议。然而,著名学者Gary Marcus撰文指出,外界对 Astra 的狂热追捧犯了典型的“合成谬误”,过分夸大了其通用性。
Gary Marcus强调,人工智能在数学上取得成功并非偶然,而是因为数学非常适合使用符号工具进行验证,并且能够以极低成本批量生成正确的合成数据。然而,这种特定领域的突破并不能轻易推广至所有认知任务。现实世界中的开放式问题远比数学复杂,无法通过简单的模拟来解决。
此外,由于OpenAI尚未公布 Astra 的具体方法细节与评估基准,外界对其真实能力的认知仍然十分有限。多位专家提醒,数学能力的提升并不能自动消除模型幻觉,也不意味着通用人工智能(AGI)的到来,公众和业界在看待此类技术进展时应保持理性和克制。
via AI新闻资讯 (author: AI Base)
来自频道: @AI_News_CN