AI 技术情报 · 2026-07-16
从 29 条内容中精选 17 条 AI/ML 重要动态
从 29 条内容中筛选出 17 条重要资讯。
- Stripe 与 Advent 联合出价超 530 亿美元收购 PayPal ⭐️ 9.0/10
- Thinking Machines 发布 Inkling:支持音频的开源权重多模态模型 ⭐️ 8.0/10
- 13 年前 Xeon 无 GPU 跑 Gemma 4 26B 达 5 tokens/秒 ⭐️ 8.0/10
- xAI 的 Grok Build 代码库因隐私泄露事件而开源 ⭐️ 8.0/10
- lobste.rs 现已迁移至 SQLite 运行 ⭐️ 8.0/10
- Armin Ronacher 警告:AI 代理可能破坏软件开发中的共识构建 ⭐️ 8.0/10
- 新多智能体协调基准:Gemini 3.1 Pro 零样本匹敌最佳 MARL 智能体 ⭐️ 8.0/10
- 提议:为 SQLite 引入 Rust 风格的版本机制以向后兼容地改进默认行为 ⭐️ 7.0/10
- 研究员绕过 Claude web_fetch 防护机制窃取用户隐私数据 ⭐️ 7.0/10
- Dependabot 默认等待三天后才创建版本更新 PR ⭐️ 7.0/10
- 首篇论文通过 Hadamard 积聚类方法解耦卷积神经元 ⭐️ 7.0/10
- SRM-LoRA:基于次黎曼度量的 LLM 幻觉抑制方法 ⭐️ 7.0/10
- 增量索引构建中的常见陷阱与教训 ⭐️ 7.0/10
- 专栏文章呼吁为免费开源 AI 提供资金 ⭐️ 6.0/10
- Simon Willison 发布 Mermaid 转 Unicode 字符画的浏览器工具 ⭐️ 6.0/10
- Simon Willison 为 Codex Desktop 打造自定义动画鹈鹕宠物 ⭐️ 6.0/10
- PyTorch 模型在 T4 上比 A100 慢 170 倍 ⭐️ 6.0/10
№ 01Stripe 与 Advent 联合出价超 530 亿美元收购 PayPal ⭐️ 9.0/10
据消息人士透露,Stripe 与私募股权公司 Advent International 联合提出以超过 530 亿美元收购 PayPal。此举可能将多家主要在线支付平台整合至同一所有权下。 此次收购将打造数字支付领域的巨头,可能削弱在线结账和支付处理市场的竞争。这引发了重大的反垄断担忧,并可能影响全球商户和消费者的费用。 该交易将汇集 Stripe、PayPal、Venmo、Braintree 和 Xoom,导致无卡交易市场高度集中。反垄断监管机构可能要求剥离 Venmo 或 Braintree 等资产,以批准合并。
hackernews · rvz · 7月15日 03:32 · 社区讨论
背景: Stripe 是面向在线企业的主要支付处理平台,而 PayPal 是数字支付的先驱,并拥有 Venmo(点对点支付)、Braintree(支付网关)和 Xoom(汇款服务)。Advent International 是一家全球性私募股权公司。此次潜在收购将整合这些在无卡结账市场占据主导地位的公司,即消费者无需出示实体卡即可支付的场景。
社区讨论: 整体情绪谨慎,许多评论者强调了反垄断风险和潜在的费用上涨。一些人指出,PayPal 的衰退和向直接支付的转变使得整合不可避免,而另一些人则担心 Stripe 对某些行业(如大麻、成人内容)更严格的限制政策可能会损害之前由 PayPal 服务的商户。
标签: #fintech, #payments, #acquisitions, #antitrust, #consolidation
№ 02Thinking Machines 发布 Inkling:支持音频的开源权重多模态模型 ⭐️ 8.0/10
Thinking Machines 发布了 Inkling,这是一个开源权重的多模态模型,支持音频处理,旨在通过其 Tinker 平台进行定制化和微调。 这填补了开源权重音频模型的空白,使企业能够拥有并微调前沿级模型以完成特定任务,可能降低对闭源模型的依赖并削减成本。 Inkling 并非最强大的总体模型,但它结合了多模态能力、高效推理和在 Tinker 上可微调的特性。可通过 llama.cpp 和 Unsloth 等工具本地运行,Hugging Face 上提供了 GGUF 和 NVFP4 格式。
hackernews · vimarsh6739 · 7月15日 18:12 · 社区讨论
背景: 开源权重模型公开其训练参数,允许任何人下载、使用、研究和修改。Tinker 是 Thinking Machines 的平台,旨在通过处理计算和基础设施来简化微调和定制化。具有音频能力的多模态模型在开源权重领域仍相对少见。
参考链接:
社区讨论: 社区普遍对新的开源权重音频模型感到兴奋,许多人分享本地部署链接。评论者认为其作为企业微调基础很有前景,并可能是美国应对开源中国模型的竞争者,尽管有人指出它并非总体最强。
标签: #open-weights, #multimodal, #AI, #machine-learning, #audio
№ 0313 年前 Xeon 无 GPU 跑 Gemma 4 26B 达 5 tokens/秒 ⭐️ 8.0/10
一项新实验展示了在 13 年前的双路 Xeon CPU 上无 GPU 运行 Google Gemma 4 26B MoE 模型,达到 5 tokens/秒,并进行了与云推理的成本效益对比分析。 该实验挑战了先进大模型必须依赖昂贵 GPU 的假设,表明即使老旧 CPU 也能运行大型模型,尽管速度较慢。其成本对比显示本地推理的电费可能接近云 API 费用,引发了关于自托管与云服务的讨论。 Gemma 4 26B 采用混合专家架构,总参数 26B 但每次推理仅激活 4B,使其能在 CPU 上运行。成本分析显示,生成 1.8 万 token 本地电费约 0.15 美元,而云端仅 0.005 美元,但大规模下本地每百万 token 成本 0.30 美元与 OpenRouter 定价持平。
hackernews · neomindryan · 7月15日 15:34 · 社区讨论
背景: Gemma 4 是 Google 发布的最新开源模型系列,包含密集和 MoE 架构;26B MoE 版本每次推理仅激活 4B 参数,使其更高效。CPU 推理指使用通用处理器而非 GPU 运行 AI 模型,速度较慢但对于激活参数少的模型可行。实验所用的 Xeon 处理器是 2012 年左右的服务器 CPU,5 tokens/秒的速度对某些交互场景可用,但远慢于云端。
参考链接:
社区讨论: 社区讨论总体积极,用户分享了未来本地大模型可行性的预测,以及个人运行类似模型的经验。核心争论集中在成本上:一些人认为本地推理电费可能超过廉价的云 API 价格,而另一些人指出在大规模下本地成本可能持平。还有用户报告在类似硬件上获得了更高速度,表明配置差异影响很大。
标签: #LLM inference, #CPU inference, #hardware, #cost analysis, #Gemma
№ 04xAI 的 Grok Build 代码库因隐私泄露事件而开源 ⭐️ 8.0/10
xAI 的 grok 命令行工具被发现在未明确获得用户同意的情况下,将整个用户目录(包括 SSH 密钥和密码数据库等敏感文件)上传至云存储。在遭到强烈反对后,该公司禁用了该功能,承诺删除所有已上传数据,并以 Apache 2.0 许可开源了 Grok Build 代码库。 此事件暴露了可访问本地文件的 AI 编码助手的严重隐私风险。通过开源,xAI 试图恢复信任,社区现在可以审计代码以发现更多漏洞。 该代码库使用 Rust 编写,有 844,530 行代码(仅约 3% 为供应商代码),包含一个独立的终端 Mermaid 图渲染器,以及模仿其他编码代理的工具实现。xAI 表示数据保留现已默认关闭,所有之前保留的编码数据将被删除。
rss · Simon Willison · 7月15日 23:59
背景: grok CLI 是 xAI 推出的编码辅助工具,类似于 GitHub Copilot CLI,可以读取和编辑用户项目目录中的文件。Google Cloud Storage 是一种将数据存储在“存储桶”中的云服务,通常用于云备份。SSH 密钥是用于安全远程服务器认证的加密密钥,泄露它们可能导致对系统的未授权访问。
参考链接:
社区讨论: 社区成员注意到了代码库中令人惊讶的功能,如终端 Mermaid 渲染器。一些人认为开源是恢复信任的战术性举措,而非真正的改革。其他人则称赞模型质量和框架的流畅性,并且已经出现了注重隐私的分支,如“gork-build”和“dgrok”。
标签: #AI, #open source, #security, #privacy, #xAI
№ 05lobste.rs 现已迁移至 SQLite 运行 ⭐️ 8.0/10
社区网站 Lobsters 已完成将其 Rails 应用从 MariaDB 迁移到 SQLite,CPU 和内存使用率下降,网站响应更快,VPS 成本减半。 这是一个真实的生产环境案例,证明了 SQLite 足以支撑社区网站的负载,挑战了它仅适用于小型或开发环境的假设,并为更简单、更经济的架构提供了蓝图。 该网站现在运行在单个 VPS 上,主 SQLite 数据库文件为 3.8GB,另有缓存数据库(1.1GB)、队列数据库(218MB)和用于防滥用的 rack_attack 数据库(555MB)。迁移代码增加了 735 行,删除了 593 行,涉及 30 次提交和 188 个文件。
rss · Simon Willison · 7月14日 19:44
背景: Lobsters 是一个类似于 Hacker News 的社区链接聚合网站。它最初使用 MariaDB(一个流行的开源关系型数据库)。SQLite 是一种轻量级、基于文件的数据库引擎,常用于嵌入式系统,但越来越多地被用于 Web 应用。Lobsters 团队自 2018 年起就在计划数据库迁移,最初目标是 PostgreSQL,后于 2024 年决定转向 SQLite。
标签: #sqlite, #database-migration, #rails, #production, #case-study
№ 06Armin Ronacher 警告:AI 代理可能破坏软件开发中的共识构建 ⭐️ 8.0/10
Flask 框架的创造者 Armin Ronacher 发表博文指出,软件项目的共识理解是通过摩擦(如代码审查、跨团队协调和解释变更)建立的,并警告 AI 编码代理可能绕过这一过程,从而削弱它。 这一观点揭示了 AI 代理日益普及的关键权衡:虽然它们减少摩擦并加速开发,但也可能侵蚀同步团队理解、维护系统一致性的协作互动。 Ronacher 将项目的共识语言描述为对概念、边界、不变式和所属权的共同理解——很少被完整记录,而是存在于代码审查、争论和解释变更的经验中。AI 代理若无此互动即进行更改,可能导致团队失去共享上下文并产生分歧假设。
rss · Simon Willison · 7月14日 18:04
背景: Armin Ronacher 是知名软件工程师,以创建 Flask Web 框架而闻名。他的博客经常探讨软件工程哲学。‘代理工程’指的是使用能够自主规划、编写和修改代码的 AI 代理,这一趋势在软件行业迅速升温。
标签: #software engineering, #AI agents, #collaboration, #system design, #software development
№ 07新多智能体协调基准:Gemini 3.1 Pro 零样本匹敌最佳 MARL 智能体 ⭐️ 8.0/10
新基准 Alem 评估了 13 个 LLM 在开放式多智能体协调任务中的表现。大多数智能体平均仅获得约 6%的标准化回报,但 Gemini 3.1 Pro 零样本性能与训练了 10 亿环境步的最佳 MARL 智能体相当。 这表明协调是超越长时序任务能力的独特瓶颈,且 LLM 无需显式协调训练即可匹敌大量训练的 RL 智能体。这标志着构建协作 AI 系统的方式可能发生转变,有望减少对昂贵的 MARL 训练的依赖。 该基准包含九个可控制协调需求的关卡,要求智能体进行探索、通信、交易、制作、建造和战斗。消融实验中通信的影响最大,项目提供了代码、排行榜和交互轨迹。
reddit · r/MachineLearning · /u/ktessera · 7月14日 15:37
背景: 多智能体强化学习(MARL)训练智能体协作,通常需要数百万步的训练。零样本协调(ZSC)测试智能体在未见过的伙伴上协作的能力,无需微调。LLM 越来越多地被用作智能体,但其在开放式世界中的协调能力此前尚未充分探索。
参考链接:
标签: #multi-agent systems, #LLM coordination, #benchmarking, #MARL, #reinforcement learning
№ 08提议:为 SQLite 引入 Rust 风格的版本机制以向后兼容地改进默认行为 ⭐️ 7.0/10
一位开发者发表博文建议 SQLite 采纳类似 Rust 的“版本”系统,允许用户通过类似 'PRAGMA edition = 2026' 的语句选择加入更新的、更合理的默认行为和改进,而不会破坏现有数据库。 该提议有望以结构化方式解决 SQLite 长期存在的古怪行为(如 SQLITE_BUSY、外键约束和隐式类型处理),让新项目在获得更安全默认设置的同时,不牺牲数百万嵌入式应用所依赖的向后兼容性。 该机制类似于 JavaScript 的 'use strict',但关键挑战在于跨版本数据库可移植性:旧版 SQLite 可能无法识别新版本而无法读取数据库,这与 Rust 所有版本最终编译为相同内部表示的方式不同。
hackernews · gnyeki · 7月15日 22:42 · 社区讨论
背景: Rust 版本是一种语言特性,允许以受控方式引入不向后兼容的更改;不同版本的代码可共存于同一代码库,且最终都编译为相同的中间表示。SQLite 是广泛使用的嵌入式数据库,以稳定性和向后兼容性为首要原则,常常保留古怪的遗留行为以避免破坏现有应用。该项目的哲学历来避免配置选项并保持默认值不变,但这导致了一些长期存在的痛点。
参考链接:
社区讨论: Hacker News 上的评论总体积极,很多人赞赏这种对替代默认值的具体提议。但也有人担心,如果旧版 SQLite 无法识别版本,在不同机器间移动数据库文件时可能会出错;还有人指出,像 APSW 这样的封装库已经提供了类似的“最佳实践”默认设置。
标签: #SQLite, #databases, #Rust, #software design, #backward compatibility
№ 09研究员绕过 Claude web_fetch 防护机制窃取用户隐私数据 ⭐️ 7.0/10
Ayush Paul 发现 Claude 的 web_fetch 工具存在漏洞,攻击者可通过诱导 AI 助手访问精心构造的恶意网站,逐步泄露用户的姓名、居住城市和雇主等隐私信息,从而绕过了 Anthropic 为防止数据外泄而设置的限制。 该漏洞突显了 AI 代理在融合访问私有数据与网页浏览能力时面临的提示注入和数据外泄持续风险。即便精心设计的防护机制也可能被绕过,这强调了在交互不可信内容的工具中实施更强大防御的必要性。 攻击利用了 web_fetch 能够跟随已抓取页面中嵌入链接的特性;恶意网站通过用户代理检测仅向 AI 客户端展示攻击,并让代理按字母顺序导航 URL 以逐步泄露数据。Anthropic 随后移除了 web_fetch 跟踪抓取内容中额外链接的功能,堵住了漏洞。
rss · Simon Willison · 7月15日 14:21
背景: 提示注入是一种攻击方式,攻击者将恶意指令嵌入不可信内容(如网页)中,诱使大语言模型执行非预期操作。Claude 的 web_fetch 工具用于获取网页内容,但与私有用户数据结合时,会构成‘致命三重奏’(即私有数据、不可信输入和外泄能力)风险。Anthropic 的初始防护措施是限制 web_fetch 仅能访问用户明确输入或搜索工具返回的 URL,从而防止直接注入外泄链接。
参考链接:
- Claude Memory Heist: web_fetch PII Exfiltration - explainx.ai
- The lethal trifecta for AI agents: private data, untrusted content, and external communication
- Web fetch tool - Claude Platform Docs
标签: #AI security, #prompt injection, #Claude, #data exfiltration, #vulnerability
№ 10Dependabot 默认等待三天后才创建版本更新 PR ⭐️ 7.0/10
GitHub Dependabot 引入了一项新的默认行为:在新包版本发布到注册表后,会等待至少三天才自动创建版本更新拉取请求。这一‘依赖冷却期’现已默认启用,无需任何配置。 这一改动显著提升了开源供应链安全,防止自动采纳可能被劫持的新发布包,因为大多数恶意包会在数小时或数天内被检测到。它为所有使用 Dependabot 的开发者提供了一种无需配置的实用防御措施。 冷却期为三天,仅适用于版本更新,不适用于安全补丁。该功能现已成为所有启用 Dependabot 的仓库的默认设置,与安全社区倡导的更广泛的‘依赖冷却期’概念相一致。
rss · Simon Willison · 7月14日 22:43
背景: Dependabot 是 GitHub 集成的自动化工具,用于扫描仓库中的过时依赖项并创建拉取请求以进行更新。依赖冷却期是一种供应链安全技术,指示包管理器忽略存在时间不足一定天数的版本,以便恶意包被检测和移除。这种方法有助于减轻拼写欺诈、依赖混淆和账户劫持等风险,近年来在安全社区中受到广泛关注。
参考链接:
标签: #dependency-cooldowns, #dependabot, #security, #supply-chain, #github
№ 11首篇论文通过 Hadamard 积聚类方法解耦卷积神经元 ⭐️ 7.0/10
一项新技术通过对卷积神经元的感受野与权重的 Hadamard 积进行聚类,揭示了不同的单语义模式,如汽车、猫、狗,以及字母、人脸等低值聚类。该方法为深入分析 InceptionV1 中单个神经元如何检测多个概念提供了新视角。 该研究为机制可解释性提供了一个实用工具,能剖析卷积神经元的内部结构,揭示了梯度下降如何在单个神经元中同时组织高、低层概念。这有助于理解特征表示的内在机制,对构建更透明、更对齐的 AI 系统至关重要。 该方法应用于 InceptionV1 模型 mixed4e 层的一个 1x1 卷积神经元。对 Hadamard 积进行聚类后,得到了已知激活模式的清晰单语义聚类,而低值聚类显示其依赖神经元也响应同一概念,且正负权重均匀分布以降低总激活值,这为梯度下降刻意组织信息提供了证据。
reddit · r/MachineLearning · /u/narang_27 · 7月15日 06:59
背景: 机制可解释性旨在通过分析神经网络内部回路和算法来逆向工程其工作原理。Hadamard 积是两矩阵的逐元素乘积,此处用于将神经元的感受野(输入作用区域)与其学习到的权重结合。单语义性指神经元或特征仅响应单一明确概念,而多语义神经元则混合多种概念。本文延续了“蒸馏电路”的研究思路,致力于提升卷积神经网络的可解释性。
参考链接:
- Mechanistic interpretability
- Hadamard product (matrices) - Wikipedia
- Towards Monosemanticity: Decomposing Language Models With Dictionary Learning \ Anthropic
标签: #mechanistic interpretability, #convolutional neural networks, #feature visualization, #neuron disentanglement, #deep learning
№ 12SRM-LoRA:基于次黎曼度量的 LLM 幻觉抑制方法 ⭐️ 7.0/10
该论文提出了 SRM-LoRA,一种利用次黎曼几何重塑 LoRA 梯度更新的微调方法,旨在减少大语言模型的幻觉现象。该研究已被 ICML 2026 FoGen 研讨会接收,并提供了开源代码。 大语言模型的幻觉问题仍是可靠 AI 系统的重大挑战。该方法通过数学原理抑制不稳定的更新方向,且不改变推理效率,有望提升各类任务的事实准确性。 该方法通过损失梯度与参数梯度之比构建基于敏感度的黎曼度量,对有害更新施加制动。仅在 HaluEval-QA 幻觉基准上训练即可泛化到分布外测试,且前向计算和推理成本不变。
reddit · r/MachineLearning · /u/Round_Apple2573 · 7月14日 10:13
背景: 次黎曼几何将运动限制在特定的水平方向,是对黎曼几何的推广,常用于控制理论。LoRA(低秩适应)是一种参数高效微调技术,仅训练低秩矩阵即可适配大模型。HaluEval-QA 是一个包含人工标注的幻觉和事实答案的基准数据集,用于评估 LLM 的幻觉程度。
参考链接:
- Sub-Riemannian geometry
- LoRA
- GitHub - RUCAIBox/HaluEval: This is the repository of HaluEval, a large-scale hallucination evaluation benchmark for Large Language Models. · GitHub
标签: #LLM hallucination, #LoRA, #sub-Riemannian geometry, #fine-tuning, #ICML workshop
№ 13增量索引构建中的常见陷阱与教训 ⭐️ 7.0/10
一位机器学习工程师分享了增量向量索引管道的实战经验,指出删除、部分更新和幂等性相关的缺陷往往在长期运行后才会暴露。 比起嵌入模型或分块策略,这些运维陷阱很少被讨论,但它们会直接导致数据陈旧、索引漂移和重复记录,降低生产环境向量存储的搜索质量。 删除操作会导致索引膨胀并残留幽灵文档;部分更新在分块边界变动时引起索引偏移;缺乏幂等性则会在每次重试或回填时生成重复文档。
reddit · r/MachineLearning · /u/Whole-Assignment6240 · 7月14日 22:21
背景: 增量索引只更新变化的数据,避免全量重建,以降低成本和延迟。向量存储用于存放嵌入向量以支持语义搜索,常用于 RAG 系统。幂等性保证重复处理同一输入得到相同结果,防止分布式管道中出现重复数据。这些是可靠数据管道的基础概念,但在 AI 驱动的技术栈中常被忽视。
参考链接:
- Incremental Indexing Strategies for RAG Systems | Medium
- Vector store
- Idempotency Explained: The Foundation of Reliable Data Pipelines
标签: #incremental indexing, #vector stores, #data pipelines, #machine learning engineering, #pitfalls
№ 14专栏文章呼吁为免费开源 AI 提供资金 ⭐️ 6.0/10
David Siegel 在《财富》杂志的一篇专栏文章中主张,政府、企业和非营利组织应投资于免费开源人工智能,并指出这与历史上的开源软件运动有相似之处。 这一呼吁凸显了专有 AI 系统与对公众可及、透明的替代方案需求之间的日益紧张关系,可能影响 AI 开发的资助和治理方式。 该专栏文章据称取材于 Siegel 与“开源之父”(可能是 Richard Stallman)长达两年的辩论,并将当前的 AI 之战与相同的原则联系起来。文章由 Siegel Endowment 发布。
hackernews · bilsbie · 7月15日 21:16 · 社区讨论
背景: 以 Richard Stallman 等人为先驱的开源软件运动倡导自由获取源代码和社区协作。如今,大型语言模型等 AI 模型往往以开放权重或开源形式发布,但关于最先进的 AI 是否应为专有、还是由公共资助以确保广泛获取和安全性的争论仍在继续。
社区讨论: 评论意见不一:有用户建议设立带特定硬件基准的奖励机制;另一人认为由于开发者受雇,商业 AI 将占据主导;还有人指出无需开源代码也能分享知识;还有评论反对公共资助 AI,优先考虑社会服务。总体而言,人们对与商业激励竞争持怀疑态度,但也支持结构化的激励措施。
标签: #open source AI, #funding, #policy, #op-ed, #community discussion
№ 15Simon Willison 发布 Mermaid 转 Unicode 字符画的浏览器工具 ⭐️ 6.0/10
Simon Willison 构建了一个基于浏览器的工具,能将 Mermaid 图表语法转换为 Unicode 字符画。他从 xAI 的 Grok CLI 代码库中提取了一个 Rust 编写的终端渲染器,并将其编译为 WebAssembly 在浏览器中运行。 该工具展示了如何通过 WebAssembly 将终端代码复用于浏览器,使得 Mermaid 图表能在无法或不便使用图形渲染的环境中呈现为纯文本。它体现了将 Rust 库编译为 Wasm 用于 Web 应用的趋势。 该工具利用了 xai-grok-markdown 包中用 Rust 实现的 '自包含的 Mermaid 图表终端渲染器',并将其编译为 WebAssembly。它提供了最大宽度设置、复制为文本和复制图表链接等控制项。
rss · Simon Willison · 7月16日 00:33
背景: Mermaid 是一种基于文本的图表绘制语言,可用简单的描述生成流程图、时序图等。WebAssembly(Wasm)是一种二进制指令格式,允许 Rust 等语言编译后在浏览器中以接近原生性能运行。Grok CLI 是 xAI 的终端编程代理,其代码库包含一个用于在终端渲染 Mermaid 图表的 Rust 包,Willison 将其复用于浏览器。
参考链接:
标签: #mermaid, #webassembly, #rust, #terminal, #diagrams
№ 16Simon Willison 为 Codex Desktop 打造自定义动画鹈鹕宠物 ⭐️ 6.0/10
Simon Willison 为 Codex Desktop 创建了一个名为 "Pedalican" 的自定义动画宠物,利用 GPT-5.6 Sol 和 gpt-image-2 生成精灵图和动画循环,并将完整制作过程记录在公开仓库中。 该项目展示了用户如何通过类似 Clippy 的交互式角色个性化 AI 编码助手,并凸显了 AI 辅助精灵图生成在定制界面中的新兴潜力。 该宠物是一只骑自行车的鹈鹕,包含挥手等动画,由 gpt-image-2 根据详细提示生成。支持此功能的关键开源技能是 openai/skills 中的 "hatch-pet" 和 openai/codex 中的 "imagegen",均采用 Apache 2.0 许可。
rss · Simon Willison · 7月14日 22:29
背景: Codex Desktop 是 OpenAI 推出的本地轻量级编码代理,它包含一个添加动画“宠物”的功能,类似于微软旧版的 Office 助手(Clippy),用于提供编码任务的状态更新。用户可以通过技能和 AI 图像生成模型(如 gpt-image-2)创建自定义宠物,开源的 "hatch-pet" 和 "imagegen" 技能就是此功能的实现示例。
参考链接:
标签: #openai, #codex, #ai-assistant, #customization, #developer-tools
№ 17PyTorch 模型在 T4 上比 A100 慢 170 倍 ⭐️ 6.0/10
一位用户报告称,一个使用 4D 相关体积和 Transformer 的点追踪模型在 NVIDIA T4 GPU 上的运行速度比 A100 慢 170 倍。已经排除了设备放置、GPU 利用率和 cuDNN 基准测试等常见设置问题。 这种极端的性能下降突显了某些深度学习架构(尤其是密集相关操作)可能严重受限于 Tensor Core 和显存带宽等硬件特性。这对那些可能认为性能会在不同代 GPU 之间线性扩展的从业者来说是一个警示。 该模型使用纯 FP32 精度,构建局部 4D 相关体积,并应用 Transformer 层来处理时序上下文。T4 的 GPU 利用率达到 99%,且该减速现象在另外两台独立机器上可复现,排除了驱动或设置问题。
reddit · r/MachineLearning · /u/Future-Structure-296 · 7月15日 13:44
背景: NVIDIA A100 GPU 采用 Ampere 架构,拥有高显存带宽和可加速矩阵运算的 Tensor Core,而 T4 则基于较旧的 Turing 架构,计算和存储能力低得多。4D 相关体积计算两帧特征图之间的所有像素对相似度,生成一个巨大的张量(高×宽×高×宽),这既耗费显存又极度依赖矩阵乘法。在 T4 上,由于缺乏大型 Tensor Core 和较低带宽,这类运算可能回退到较慢的 CUDA 核心,导致性能下降远超简单的浮点运算次数之比。
参考链接:
- visual-slam-roadmap/level-05- deep - learning /raft.md at main...
- [[2501.18487] Track-On: Transformer-based Online Point ... Images GitHub - gorkaydemir/track_on: ICLR 25, TPAMI 26, CVPR 26 ... Track-On: Transformer-based Online Point Tracking with Memory Track-On: Transformer-based Online Point Tracking with Memory Online Long-term Point Tracking in the Foundation Model Era GitHub - facebookresearch/co-tracker: CoTracker is a model ... THT-Net: A Novel Object Tracking Model Based on Global-Local ...
标签: #GPU performance, #PyTorch, #T4 vs A100, #transformer, #deep learning optimization