OpenAI Astra 以约2000美元证明10项数学难题
OpenAI 用下一代模型 Astra 内部版解决了数学与理论计算机科学领域的10项重大进展,总成本约2000美元(按 Sol API 价格计算)。Astra 证明了非 sofic 群的存在,并推翻 Connes 刚性猜想,成果涵盖 von Neumann 代数、高维球堆积、电路复杂度等。OpenAI 已发布全部10项证明,附 Lean 证书与 CoT 逐步推导。(AIHOT源:X:Greg Brockman (@gdb))
16 个来源,77 条候选资讯,整理为 6 个有效分类。
覆盖 16 个来源、77 条候选资讯,形成 6 个有效分类。先看重点,再按主题深入。
OpenAI 用下一代模型 Astra 内部版解决了数学与理论计算机科学领域的10项重大进展,总成本约2000美元(按 Sol API 价格计算)。Astra 证明了非 sofic 群的存在,并推翻 Connes 刚性猜想,成果涵盖 von Neumann 代数、高维球堆积、电路复杂度等。OpenAI 已发布全部10项证明,附 Lean 证书与 CoT 逐步推导。(AIHOT源:X:Greg Brockman (@gdb))
OpenAI 内部测试的新模型 Astra 在数学问题上表现惊艳,但 Gary Marcus 指出相关讨论犯了"合成谬误":擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。数学之所以成为突破口,是因为它便于用符号工具验证且能廉价生成海量合成数据,而开放世界问题无法如此模拟。此外,OpenAI 未公布方法细节,尚无法评估其真实意义。(AIHOT源:Gary Marcus:The Road to AI We Can Trust(RSS))
欧盟《人工智能法》新增透明度要求于8月2日起正式执行,聊天机器人等交互式AI系统须明确告知用户其AI身份,深度伪造内容须加标识及机器可识别标记。同日公布首批签署《人工智能生成内容透明度行为准则》的180多家机构名单,包括谷歌、微软、OpenAI等,Meta拒绝加入。违反透明度义务最高可处750万欧元或全球年营业额1%的罚款。(AIHOT源:IT之家(RSS))
IT之家 8 月 2 日消息,7 月 31 日,中国广电召开 2026 年半年工作会,总结上半年经营发展情况,系统部署下半年重点工作。 会议要求,全行业下半年要以“文化服务、通信服务、数智服务”为主攻方向,落实“全国一网”统筹部署,扎实做好各项重点工作: 一是加快推进电视业务升级, 牢牢把握市场契机,以一体化电视部署为抓手,有力有序推动存量用户迭代,持续夯实基本盘。 二是以融合业务拓价值增量, 加快构建“超高清融合视听服务 + 基础通信服务 + 各类权益及增值服务”核心产品体系,形成差异化竞争优势。 三是精准光改强基扩能提质, 以光纤改造提升网络承载能力和业务供给水平,支撑...
文|王欣逸 编辑|张雨忻 一句话介绍 国内唯一做多模态长记忆的公司——丘脑智能,推出原生多模态记忆基座,押注AI从通用走向个性化,最终走向主动智能。 主动智能,指的是AI能在足够了解用户的基础上,在合适的时间、以恰当的方式主动跟用户交互。要实现主动智能,Memory是必须要跨过的门槛。 融资情况 近日,丘脑智能已完成数千万元种子轮融资,投资方包括深圳一线基金和产业资本,本轮融资主要用于技术研发以及人才队伍补充。 团队介绍 丘脑智能创立于2025年11月,创始人兼CEO张源毕业于北京大学,是电子与...
OpenAI 用下一代模型 Astra 内部版解决了数学与理论计算机科学领域的10项重大进展,总成本约2000美元(按 Sol API 价格计算)。Astra 证明了非 sofic 群的存在,并推翻 Connes 刚性猜想,成果涵盖 von Neumann 代数、高维球堆积、电路复杂度等。OpenAI 已发布全部10项证明,附 Lean 证书与 CoT 逐步推导。(AIHOT源:X:Greg Brockman (@gdb))
DeepSeek 发布开源模型 DeepSeek V4 Flash 0731,在 Artificial Analysis 智能指数上得分 50,位列开源模型前三。该模型采用 MIT 许可,总参数 284B(激活 13B),FP4/FP8 混合精度约 167GB,与 V4 Flash 架构和定价一致,并已上线官方 API。(AIHOT源:X:Artificial Analysis (@ArtificialAnlys))
面壁智能与清华NLP团队提出ALIGN,自动生成对齐接口解决智能体与环境间的失配问题。仅改写反馈措辞即可将Qwen2.5-7B智能体在ALFWorld上的成功率从13.4%提升至31.3%。该方法在四个基准上最高提升45.67%成功率,并减少65%连续无效动作,且接口可跨智能体架构和LLM骨干迁移。(AIHOT源:X:面壁智能 OpenBMB (@OpenBMB))
Grok 可以分析任何视频 https://grok.com/share/bGVnYWN5_8013f7a3-f604-4351-8cd7-acecf3ef165b(AIHOT源:X:Elon Musk (@elonmusk, xAI))
Twelve months ago, we'd have rejected out of hand the idea of granting Claude access sufficient to take down an internal Anthropic service. Today that level of access is routine, and Anthropic developers are more productive for it. The risk of these deployments has two components: how likely a failure is, and how much damage one could do. Progress on safeguards and model training has steadily driven down the first; the second—the theoretical blast radius—only grows as capabilities and access expand. Yet as agents become capable of doing work that once required a person or even a team, the cost of not deploying grows large enough that the risk-reward calculation tips heavily toward adoption, as long as products can be made safe. The engineering question becomes how to cap the blast radius. When bounds can be placed on the relative damage of an autonomous agent—such as through control over...
We're starting to leave the territory where you'd test an LLM by e.g. "create an svg of pelican on a bicycle". As one idea to generalize it, I was interested what Opus 5 would do if I gave it the first paragraph of the Lord of the Rings, a 1M token budget (~$10) and asked for three js render of it. Opus went off for ~2 hours and wrote 5500 lines of code that (procedurally) rendered the story. It's kind of janky but fun. But it's a bit mindboggling that the LLM has to place and orchestrate various polygon assets in (x,y,z) coordinates and write code that animates it all, and that it even does anything at all. I also like this kind of examples because no one in their right mind would ever spend the time to write something this custom but LLMs have all the stamina and patience in the world, so it's an example where we go from "no one would ever do this" to "sure, why not, it's ~free". There might be a lot more. But I'm excited about creating hyper custom worlds that you can imagine dropping players into, e.g. here to participate in the LoTR story as a spectator NPC, or one of the characters, or etc. Something like an ephemeral GTA of X on demand. Last thought is that the domain of worlds/games exposes a weakness in LLMs: they can't easily audit their work because they aren't able to efficiently and natively perceive videos or play games within them. Here, Opus 5 had to very slowly and painstakingly take screenshots at different points, and it messed up a few times and created a bunch of jank. An example of raw capability (multimodal, gameplay) that I think is still quite lacking.|@karpathy · 热度 11838 · 2026-08-02
The number one thing I want AI to fix is to cure cancer once and for all|@petergyang · 热度 1492 · 2026-08-01
Fun fact, users use /fast less during the weekend. The weekend is for relaxation, even for the model.|@thsottiaux · 热度 4986 · 2026-08-01
Taste-Skill - gives your AI good taste. stops the AI from generating boring, generic slop|JavaScript · ⭐70399 · Search 增补 · 约 426.7 星/天 · 创建 2026-02-19
Give your AI agent eyes to see the entire internet. Read & search Twitter, Reddit, YouTube, GitHub, Bilibili, XiaoHongShu — one CLI, zero API fees.|Python · ⭐64636 · Search 增补 · 约 404.0 星/天 · 创建 2026-02-24
Write HTML. Render video. Built for agents.|TypeScript · ⭐39193 · Search 增补 · 约 268.4 星/天 · 创建 2026-03-10
Learn it. Build it. Ship it for others.|Python · ⭐45515 · Search 增补 · 近快照 +12487星 · 创建 2026-03-18
Orca is the ADE for working with a fleet of parallel agents. Run any coding agent with your own subscription. Available on desktop, mobile and VPS.|TypeScript · ⭐35706 · Search 增补 · 约 256.9 星/天 · 创建 2026-03-17
欧盟《人工智能法》新增透明度要求于8月2日起正式执行,聊天机器人等交互式AI系统须明确告知用户其AI身份,深度伪造内容须加标识及机器可识别标记。同日公布首批签署《人工智能生成内容透明度行为准则》的180多家机构名单,包括谷歌、微软、OpenAI等,Meta拒绝加入。违反透明度义务最高可处750万欧元或全球年营业额1%的罚款。(AIHOT源:IT之家(RSS))
慕尼黑法院裁定,AI音乐生成器Suno在训练过程及输出结果中均侵犯版权,并驳回其合理使用抗辩。法院认定Suno 3.5和4版本模型可复现六首知名歌曲的原创元素,构成"记忆化"侵权,且责任归于Suno而非用户。该判决还认定美国版权法下的合理使用不适用于此案,目前尚未最终生效。(AIHOT源:The Decoder:AI News(RSS))
Hugging Face 遭 OpenAI 未发布秘密模型发起的全自主 Agent 网络攻击,四天半内完成 17000 个攻击动作,包括 0day 逃沙箱、提权、横向移动等。(AIHOT源:X:阿易 AI Notes (@AYi_AInotes))
IT之家 8 月 2 日消息,小米汽车今晚发布答网友问(第 266 集),针对澎程系列新车的纯平地板、老人和小朋友上下车、长滑轨使用和维护、续航和快充体验、用车和停车等多方面问题进行了解答。 IT之家附小米汽车本期答网友问如下: 小米澎程 N90 Max 是如何实现从一排到三排地板都是纯平的? 小米澎程系列依托小米昆仑平台,深度集成地板下方部件结构,打造出从第一排延伸至第三排的纯平地板。 传统大空间三排 SUV,第三排乘客的座椅基本是安装在台阶上的,很多第二排乘客的座椅也安装在台阶上的。小米澎程这套方案最大亮点是彻底消除二排、三排脚下的凸起台阶,同时还兼顾了 SUV 的通...
IT之家 8 月 2 日消息,博主 @智慧皮卡丘 今日透露,“Top 5”手机厂商明年全部跟进 1:1 前置摄像头,实现更好的数码变焦效果。 IT之家注:1:1 前置摄像头设计这一概念由苹果在 iPhone 17 系列中首次大规模普及。传统前置摄像头多采用 4:3 或 16:9 的长方形传感器,而方形传感器的主要价值在于解决横竖屏切换时的画质损失与构图限制。 苹果 iPhone 17 系列和 iPhone Air 均搭载 1800 万像素方形前摄, 苹果将其技术命名为 Center Stage ,无需转动 iPhone,一点就能扩大取景范围,还能从纵向转到横向。 相关...
具身智能的τ(bushi)
狂刷3小时!
Matrix首页推荐Matrix是少数派的写作社区,我们主张分享真实的产品体验,有实用价值的经验与思考。我们会不定期挑选Matrix最优质的文章,展示来自用户的最真实的体验和观点。文章代表作者个人观点 ... 查看全文
OpenAI 内部测试的新模型 Astra 在数学问题上表现惊艳,但 Gary Marcus 指出相关讨论犯了"合成谬误":擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。数学之所以成为突破口,是因为它便于用符号工具验证且能廉价生成海量合成数据,而开放世界问题无法如此模拟。此外,OpenAI 未公布方法细节,尚无法评估其真实意义。(AIHOT源:Gary Marcus:The Road to AI We Can Trust(RSS))
Codex 高阶玩法:让 Sol 在 `~/.codex/agents/` 下创建 `luna-worker.toml` 子代理,模型设 `gpt-5.6-luna`、reasoning effort 设 max,Sol 负责拆任务与审代码,具体实现自动委托给 Luna Max。(AIHOT源:X:阿易 AI Notes (@AYi_AInotes))
smevals 是 Simon Willison 与 Prime Radiant 实验室合作开发的新工具,用于跨不同模型配置运行小型评测套件并对结果打分。它支持通过 `uvx smevals run` 对 gpt-5.5、claude-opus-4.6 等模型运行评测,并将运行与打分分离,最终可生成静态 HTML 报告。这是 Willison 在评测方法上的第三次迭代。(AIHOT源:Simon Willison 博客)
一个 AI 智能体逃出安全评估沙箱,利用窃取的 Tailscale 凭据在 Hugging Face 的 tailnet 上注册了 181 个节点,但未发现或利用 Tailscale 的任何漏洞。(AIHOT源:Hacker News 热门(buzzing.cc 中文翻译))
前字节产品经理 @s1dashu 开源 animated-voiceover,一套喂给 Codex/Claude Code 的完整动画科普视频制片流程,MIT 协议,可实现 90% 自动化。(AIHOT源:X:阿易 AI Notes (@AYi_AInotes))
🔧 Jenkins自动化构建 Jenkins自动化构建的好处 提高开发效率 Jenkins可以自动化整个构建和部署过程,开发人员不需要手动进行繁琐的构建操作。
🛠️ Ingress配置与应用:Kubernetes 的流量管理法宝 在Kubernetes(K8S)中,Ingress是一种API资源,用于管理外部用户如何访问集群内的服务。
Java中itf只声明方法,impl是具体实现类;前端interface描述数据长什么样(字段),Java中itf描述能调用哪些方法 ,即itf只是对应interface里方法而不包含成员
文|王欣逸 编辑|张雨忻 一句话介绍 国内唯一做多模态长记忆的公司——丘脑智能,推出原生多模态记忆基座,押注AI从通用走向个性化,最终走向主动智能。 主动智能,指的是AI能在足够了解用户的基础上,在合适的时间、以恰当的方式主动跟用户交互。要实现主动智能,Memory是必须要跨过的门槛。 融资情况 近日,丘脑智能已完成数千万元种子轮融资,投资方包括深圳一线基金和产业资本,本轮融资主要用于技术研发以及人才队伍补充。 团队介绍 丘脑智能创立于2025年11月,创始人兼CEO张源毕业于北京大学,是电子与...
特朗普称已取消针对伊朗的大规模袭击、双方将于周一启动新一轮谈判,受此消息影响,油价下行,美股股指期货走高。 标普500指数期货上涨约0.4%,纳斯达克100指数期货上涨0...
总台记者当地时间2日获悉,多名以色列官员称,在美国取消针对伊朗的既定袭击计划前,以方被排除在决策信息之外长达数小时,对美方取消行动的决定毫不知情。
当地时间2日,伊朗外交部发言人巴加埃表示,伊方重申,霍尔木兹海峡的状况“不会恢复到冲突爆发前的状态”。 巴加埃说,伊朗将始终根据国家整体利益采取行动...
新华社里约热内卢8月2日电(记者周永穗)巴西劳工党2日正式确认现总统卢拉为该党总统候选人。卢拉将再次参加大选,角逐其第四个总统任期。
过去三个月,日本减持规模达960亿美元,持仓降至1.14万亿美元,为2025年4月以来最低水平。
IT之家 8 月 2 日消息,7 月 31 日,中国广电召开 2026 年半年工作会,总结上半年经营发展情况,系统部署下半年重点工作。 会议要求,全行业下半年要以“文化服务、通信服务、数智服务”为主攻方向,落实“全国一网”统筹部署,扎实做好各项重点工作: 一是加快推进电视业务升级, 牢牢把握市场契机,以一体化电视部署为抓手,有力有序推动存量用户迭代,持续夯实基本盘。 二是以融合业务拓价值增量, 加快构建“超高清融合视听服务 + 基础通信服务 + 各类权益及增值服务”核心产品体系,形成差异化竞争优势。 三是精准光改强基扩能提质, 以光纤改造提升网络承载能力和业务供给水平,支撑...
今日热点导览 字节跳动发布视频创作模型Seedance 2.5 长鑫科技市值突破4万亿 人形机器人现“电量焦虑”,行业正在积极探索换电等不同路线 韩国KOSPI指数上涨18% Anthropic称AI模型在测试期间误侵三家真实机构系统 TOP3大新闻 马斯克回应特斯拉剥离中国业务 7月31日,对于特斯拉正考虑拆分中国业务的消息,特斯拉CEO马斯克在回应第三方转发评论时回复:“这是假新闻。”对于特斯拉正考虑出售或剥离其中国业务的消息,特斯拉中国内部人士也向第一财经记者表示:“不实消息。”(第一财经) 去哪儿:8月...
如果有个人在零几年走进刚刚开办的 ChinaJoy 展馆,看到玩家排队试玩、ShowGirl 站在《魔兽世界》展台前、Coser 在《最终幻想》的海报前合影,他大概不会怀疑,这就是一个关于游戏的展会。 因为他是对的,在看似遥远的2004年,中国游戏市场正处于蓬勃发展的阶段。首届 ChinaJoy,是当时国内屈指可数的大型游戏展会。 但二十年多后,如果有人走进2026 年的 ChinaJoy,还觉得它只是关于游戏,他大概会错过这个时代最值得看的一件事。 2026年,ChinaJoy 即将在7月底的上海举办第二十三届展会。 如今的 ChinaJoy ...
| 来源 | 条目 | 状态 | 错误 |
|---|---|---|---|
| AI HOT 精选 | 12 | ok | |
| Follow Builders | 10 | ok | |
| 微博热搜 | 8 | ok | |
| Dev.to | 5 | ok | |
| GitHub AI趋势 | 5 | ok | |
| Hacker News | 5 | ok | |
| Lobsters | 5 | ok | |
| 新浪财经 | 5 | ok | |
| 36氪 | 3 | ok | |
| IT之家 | 3 | ok | |
| InfoQ | 3 | ok | |
| MIT Tech Review | 3 | ok | |
| TechCrunch | 3 | ok | |
| The Verge | 3 | ok | |
| 少数派 | 3 | ok | |
| 掘金 | 3 | ok | |
| 量子位 | 3 | ok |