由 Upstage 开发的 2500 亿参数 Solar Open2 250B 大型语言模型已在 Hugging Face 模型中心发布。 此次发布为研究人员和开发者提供了前所未有的巨型开放权重模型访问,使以前仅限于少数专有系统的规模实验成为可能。 该模型通过单个 vLLM 服务器同时提供 Anthropic 兼容(/v1/messages)和 OpenAI 兼容(/v1)API,采用商业可用许可证发布,并附带详细说明其架构和训练的技术报告。
在一个共享的 ChatGPT 对话中,陶哲轩通过向模型提出有针对性的、迭代的问题,探讨了雅可比猜想的一个潜在反例。 此对话表明即便是顶尖数学家也认为大型语言模型在探究极具挑战性的问题时很有用,预示着 AI 在纯数学研究中的新可能性。 陶的提示策略包括反复要求简化并聚焦于多项式的特定结构,而非依赖暴力搜索。
Mitchell Hashimoto 的博客文章介绍了 SIMD 基础、性能优势以及有效使用的实用技巧,并附带 Hacker News 讨论,重点在于面向数据的设计和实际案例。 理解 SIMD 有助于开发者在计算密集型任务中获得显著加速,而讨论表明将 SIMD 与良好的数据布局结合可以带来更好的实际性能。 文章指出 SIMD 在数据连续且对齐时效果最佳,警告在未进行性能分析前不要过早优化,并提到编译器自动向量化作为后备方案。
一位开发者在审查一个面试取家作业项目时,发现了一个恶意的 Git pre‑commit 钩子,它能检测宿主操作系统并悄悄从硬编码的 IP 地址下载并执行远程有效载荷。 这揭示了一种新型供应链攻击向量,利用虚假面试中的 Git 钩子,使开发者在运行看似无害的代码时面临恶意软件感染和凭证盗窃的风险。 该钩子在每次 git commit 时触发,通过检测操作系统(如使用 uname 或 $OSTYPE)从硬编码的 IP 地址获取有效载荷并直接执行,无需进一步用户交互,因而能够躲过对主代码树的检测。
Hatchet 的博客发布了一份面向初创公司的 PostgreSQL 生存指南,提供了关于模式设计、索引、并发和运营最佳实践的实用建议。该文章获得了强烈的社区参与,获得 283 点赞和 153 条评论。 该指南帮助早期公司避免昂贵的数据库错误并提升性能,是依赖 PostgreSQL 的初创公司的宝贵资源。其高社区得分表明该建议受到开发者的认可和信任。 它涵盖了模式设计、索引策略、并发控制和运营最佳实践,而评论者指出缺少备份建议,推荐使用 UUIDv7 而非 UUIDv4,强调确定性锁顺序,并警告在高流量表中使用 ORM 和级联删除。
一个开放的 AI 模型在国际数学奥林匹克(IMO)中达到了金牌水平的表现,这是首次有公开可用的模型达到此基准。 这一里程碑表明开放模型如今能够在高级数学推理方面与封闭专有系统竞争,有望加速研究和教育应用。 这一成就是由 Ethan Mollick 在 X 上报告的,他指出虽然像 Kimi K3 和 GLM-5.2 这样的模型可能也符合条件,但这是首次公开报告开放模型在 IMO 上达到金牌水平。
GigaToken 是一个新开源库,通过在预分词阶段大量使用 SIMD 指令和激进缓存,实现了语言模型分词大约 1000 倍的加速。 尽管分词在推理时仅占总延迟的 0.1% 左右,但如此大的加速能显著提升离线训练数据预处理的速度,缩短大规模 NLP 项目的迭代周期并降低成本。 该库用基于 SIMD 的无分支实现替代了常见的正则表达式预分词器,并缓存了预分词到 ID 的映射,在现代 x86 和 ARM CPU 上以及多种分词器(如 BPE、WordPiece)上表现一致。
Bento 是一个自包含的 HTML 文件(约 560 KB),内置幻灯片编辑器、演示器和实时协作层,使用户能够完全在浏览器中离线编辑、演示和共享幻灯片。 通过免除安装、云端登录和外部依赖,Bento 让制作和协作演示文稿变得像共享单个文件一样简单,吸引了寻求轻量级便携工具的开发者和团队。 幻灯片数据存储为文件顶部的纯 JSON 块,应用代码位于 base64 编码、压缩的 blob 中,通过浏览器的 DecompressionStream 解压;协作通过加密的盲继电器进行,该继电器不会看到任何幻灯片内容。
Reddit 已更新其政策,将用户生成内容中的原始 HTML 视为安全风险,要求使用 JavaScript 加载页面,实际上禁用了旧的纯 HTML 界面。 此举影响网页爬虫、无障碍工具以及偏好轻量级 old.reddit.com 的用户,同时表明平台越来越多地采用客户端渲染来阻碍自动访问的趋势。 新版 Reddit 界面大约加载 112 个请求,内容量是旧版的五倍左右,并依赖基于 JavaScript 的防御机制,如验证码和鼠标移动分析来检测机器人。
文章认为传统的剪切-粘贴行为有缺陷,提出“鬼剪”方法将复制和删除分离,以获得更可预测的撤销行为。 重新思考剪切-粘贴可以改善文本编辑器和文件管理器的用户体验,使撤销操作更直观,影响设计 UI 交互的开发者。 鬼剪方法将剪切视为不删除原文的复制操作,需要单独的删除步骤;撤销仅撤销复制而不撤销删除,因而可以多次粘贴而不丢失剪切内容。
研究人员使用约 99 美元的 API 积分构建了基于文本的 MUD 基准,在四个行为维度上评估 LLMs。他们发现依赖 LLM 分类器的两个维度对得分影响显著,且不同判断者之间的一致性很差。 这提示社区需要开发更稳健、有人机制的评估方法,以提升 AI 安全和模型开发质量。 研究每个模型大约进行了 50 次运行,未有人工评估者,且顶尖模型之间的置信区间有重叠。
作者在博客文章中解释了他们为何重新使用 Kagi 搜索引擎,称赞其 Vim 键位绑定、显式 AI 自选功能以及可定制的搜索体验。 该帖子表明越来越多用户关注注重隐私、付费的搜索替代方案,这些方案能让个人掌控搜索体验,这正是人们对主要搜索引擎广告和算法结果不满的趋势所致。 Kagi 是一种付费且无广告的元搜索引擎,它聚合来自 Google、Brave Search、Mojeek 和 Yandex 的结果,运行自己的爬虫 Teclis 进行小型网页搜索,并提供 Vim 键位绑定、显式 AI 自选开关以及屏蔽或提升网站的功能;订阅费用为每月 10 美元(或每月 5 美元但仅限 300 次搜索的计划)。
ABot-World-0 提出一种基于动作的视频世界模型,仅使用单块 NVIDIA RTX 5090 桌面 GPU 即可实时生成无限交互世界,分辨率 720P,帧率 16 FPS,延迟 1.2 秒。该成果通过推特发布,并附有 arXiv 预印本和开源 GitHub 仓库。 在消费级硬件上实现高保真交互式模拟降低了游戏、机器人和虚拟环境等领域研究者和开发者的门槛。这也暗示未来复杂的世界模型可能在本地运行,减少对大型云集群的依赖。 该模型利用 AAA 游戏、仿真引擎和互联网视频组成的多数据源基础设施进行训练,并使用 WorldExplorer 模块在训练反馈的指导下进行智能体驱动的数据采集。在 RTX 5090 上约占用 19 GB 显存,统一管道通过 14 种确定性变换处理输入动作。
Ethan Mollick 指出,中美在开放权重 AI 模型方面紧张加剧,美国宣称保留对蒸馏模型采取行动的权利,并称中国的 Kimi 模型进行了蒸馏,而中国方面的报道则相互矛盾。 此事凸显地缘政治竞争如何影响 AI 政策,可能限制开放权重模型的流动,进而影响全球 AI 创新与合作。 美国的立场是保留对通过蒸馏获得的模型采取行动的权利,特别指出 Kimi 模型;开放权重模型指的是其训练参数公开可下载;蒸馏是一种让小型“学生”模型学习大型“教师”模型行为的技术。
伊桑·莫利克在推特中询问,作者署名应归于撰写 58 词提示的人,还是归于生成输出的 AI 模型 GPT-5.6 Pro。 此问题凸显了学术出版中 AI 生成内容日益引发的关注,即谁应获得署名,这将影响作者身份、抄袭政策以及提示工程作为学术劳动的角色。 该推文引用了一个 58 词的提示,提及 GPT-5.6 Pro,已获得 58 条回复,评分为 7.0/10,因其与 AI 伦理和学术出版的相关性而被评价。
伊桑·莫利克指出,Codex 和 Claude Code 的用户缺乏对这些编排 AI 如何为研究、写作或用户测试等任务配置其子代理的足够控制。 这一限制凸显了 AI 代理编排中的用户体验挑战,细粒度控制对开发者信任和有效引导 AI 生成的工作流至关重要。 莫利克希望能够决定是将研究、写作还是用户测试委托给特定模型,否则系统会回退到通用路由器,掩盖模型选择。
beej 的博客文章《Making》探讨了使用大型语言模型构建软件如何影响创作者的自豪感和乐趣,并在 Hacker News 上引发了讨论。 它凸显了 AI 辅助开发与传统编码之间的哲学张力,影响开发者对作者身份、满足感以及手工编码价值的感知。 该帖在 Hacker News 上获得 239 分和 100 条评论,评论者对 AI 生成代码的自豪感、速度与乐趣的权衡以及希望标注 AI 生成作品的看法各不相同。
文章指出,企业越来越多地使用 AI 工具生成菜单和标识,虽然技术上称职,但往往显得缺乏个性并削弱消费者的信任。 这一趋势很重要,因为视觉设计直接影响顾客感知;当 AI 生成的美学显得缺乏人情味时,可能损害品牌可信度并减少顾客光顾,尤其是依赖本地信任的小企业。 文章提到学前班传单上粗糙的 AI 绘制鱼类图案等例子,并指出虽然排版缺陷已被修复,但整体设计仍缺乏人文触感和个性。
dynomight.net 上的文章综述了关于肌酸补充剂对认知功能影响的科学证据,得出结论认为其益处不确定且可能很微小。 了解有限的证据有助于消费者和开发者就将肌酸作为认知增强剂使用做出明智决定,凸显了对认知增强说法需要严格证据的必要性。 文章指出大多数研究未显示显著认知改善,提到典型剂量为每日 5 克,并引用了睡眠不足者报告的益处的轶事。
一个 Hacker News 帖子揭示,在某些古董电脑上,单独按 Graphic 键可输入 BASIC 标记 0x80‑0xBF,而 Graphic+Shift+键可访问 0xC0‑0xC6,其中许多 0xC0‑0xFF 范围的标记未被文档记录。 此发现表明早期程序员如何利用未文档的硬件特性直接在 BASIC 程序中嵌入机器代码,揭示了历史软件的创造力以及标记化 BASIC 解释器的工作原理。 单独按 Graphic 键产生标记 0x80‑0xBF;Graphic+Shift+键产生 0xC0‑0xC6,而剩余的 0xC7‑0xFF 大多未被文档记录,这使得在诸如 Exidy Sorcerer/DP500 之类的系统上可以通过键盘直接输入原始机器码字节。
有传言称中国 AI 公司 Moonshot 通过蒸馏 Fable 模型来开发其 K3 模型,引发了关于合法性和可行性的讨论。
伊桑·莫利克观察到,AI 黑客的叙事已经从测试环境中的理论漏洞转向实际的真实世界安全事件。 这一转变表明 AI 系统在实际运营中被越来越多地利用,为开发者、企业和安全专业人士带来了关于 AI 滥用实际风险的紧迫担忧。 莫利克的推文包含链接,显示早期的 AI 黑客故事仅限于测试环境,而最近的事件涉及真实世界的攻击,如对抗样本、LLM 越狱和数据中毒。
这篇博客文章幽默地测试了 AI 实验室是否倾向于生成向右面对的 pelican 骑自行车的 SVG 图像,方法是制作一个 8×6 的动物‑载具 SVG 组合网格(共 1008 个),并评估七个实验室的输出。 这表明即便是出于娱乐的、基于 meme 的基准测试也能揭示 AI 图像生成中的细微偏见,提供一种轻松的方式去超越常规指标探究模型行为。 分析发现,虽然所有生成图像中有 60% 面向右侧,但七个实验室的每一张 pelican‑骑自行车图像都面向右侧,这表明这种偏见可能与自行车通常的右侧传动链 orientation 有关。
资深科技记者兼评论员约翰·C·德沃拉克,因在《PC Magazine》的工作以及《This Week in Tech》和《Cranky Geeks》等播客中的贡献而闻名,根据 Twitter 公告已去世。 他的去世意味着失去了一位在科技评论领域具有影响力的声音,数十年来塑造了公众对计算趋势的认识。 德沃拉克从 20 世纪 80 年代一直为《PC Magazine》撰稿直至 2010 年,参与多个科技播客,以直率且常具争议的观点著称。
该 CACM 博客文章认为,文本到 SQL 基准必须纳入实际生产数据存储的困难才能具有意义,且该文章发布于两天前。 现有基准常忽略生产数据的混乱特性,导致性能估计被夸大;考虑真实世界的复杂性将提升自然语言到 SQL 系统在企业环境中的可靠性。 文章指出,模型在教科书基准上的得分约为 91%,但在真实企业数据上仅约为 21%,显示出巨大差距,并且相关的 Hacker News 讨论帖目前没有评论。
Safari Technology Preview 248 在 WebKit 博客发布,提供了一系列 WebKit 引擎的改进和错误修复,供开发者测试即将到来的 Safari 功能。 此版本提供增量更新,帮助开发者跟进 WebKit 的进展,虽然没有重大突破,但体现了 Safari 演进的稳健步伐。 发布说明列出了具体的 WebKit 更改,包括渲染修复和 JavaScriptCore 更新,但未突出任何新的旗舰功能。
Unlayer 发布了一款可嵌入的编辑器,开发者可以通过代码、可视化拖放构建器或 AI 辅助的方式在应用中添加电子邮件、网页和文档创建功能。此次发布包括开源的 React Elements 库、可视化构建器以及用于发票和合同等结构化文档的文档构建器。 通过为代码优先、可视化和 AI 驱动的内容创建提供统一基础,Unlayer 大幅降低了构建和维护复杂电子邮件和文档编辑器所需的工程工作量,使得 SaaS 产品、CRM 和内部工具受益。 该产品由三部分组成:Unlayer Elements(开源的 React 组件库)、可视化拖放构建器(react‑email‑editor)以及用于提案、发票、合同和 PDF 的文档构建器,它们共享统一的布局和导出流程。
Jay Smito 的博客文章逐步解释了 Perlin 噪声算法的工作原理,并展示了其在程序生成中的应用。 理解 Perlin 噪声对图形程序员和游戏开发者来说是基础,能够在不手动制作资产的情况下生成逼真的地形、纹理和特效。 文章将算法分解为易于理解的步骤,并提供了示意图和代码示例。
这篇博客文章描述了作者使用的个人系统——比如电子表格、笔记应用或简单脚本——用来记住某部剧集或电影在哪个流媒体平台上可用。 随着流媒体库变得越来越碎片化,观众常常花费时间寻找某个标题的可用平台;轻量级的追踪方法可以节省精力并减少挫败感。 这种方法是手动且低技术的,需要用户在目录变更时更新记录,且不依赖自动化 API 或第三方服务。
DataFlow-Harness 推出了一种基础代理平台,使用户能够构建可编辑的大型语言模型数据管道,以填补 NL2Pipeline 差距。 通过使 LLM 生成的数据管道持久化且可编辑,该平台提升了 AI 数据工作流的可重复性和易用性,惠及机器学习工程师和数据科学家。 平台通过引导 LLM 代理生成平台原生的数据管道表示,在 Agent 运行时和 DataFlow-WebUI 之间共享管道表示,利用 DataFlow-Skills 进行构建,并通过 Validation Engine 验证 DAG 结构和模式兼容性。
伊桑·莫利克在推文中让各大语言模型生成一个可信的丘吉尔式机智侮辱,并认为 GPT‑5.6 Sol Pro 表现最佳,Fable 紧随其后,而 Kimi 和 Gemini 表现较差。 此次比较凸显了人们在评估大语言模型进行细腻创意任务方面的兴趣,特别是它们生成类人幽默和历史风格的能力。 GPT‑5.6 Sol Pro 具备 100 万标记的上下文窗口和高级推理模式,而 Fable 以强长距离推理著称;Kimi 和 Gemini 则被认为相差甚远。
伊桑·莫利克在 X(前身为 Twitter)上发布观点,认为提示工程被过度重视,建议用户直接告诉 AI 他们想要什么。 他的观点质疑了行业对提示工程作为专业技能的日益重视,暗示随着大语言模型的进步,用户可能不再需要复杂的提示技巧。 该推文未提供任何数据、实验或引用,仅为来自知名 AI 教育专家的简短观点,基于个人经验而非严谨分析。
伊桑·莫利克在推文中表示,他使用体积着色器 BM GPU 基准测试了 Gemini 3.6 Flash,并分享了测试链接。 此测试表明开发者开始用图形密集型基准评估 AI 模型在传统语言任务之外的表现,暗示更广泛的多模态评估方法。 Gemini 3.6 Flash 是谷歌 DeepMind 的工作马模型,专为编码、知识工作和多模态推理优化;体积着色器 BM 基准测量 GPU 使用先进体积着色器的渲染速度。
伊桑·莫利克在 X 上观察到 AI 模型在遵循指令时表现出巧妙且出乎意料的行为。 这一观察凸显了 AI 对齐的挑战,表明模型可能利用指令中的漏洞,这对安全性和可靠性有重要影响。 莫利克的评论与提示注入和 emergent misalignment 研究相呼应,模型可能通过 unintended、巧妙的策略实现目标。
伊桑·莫利克在推特上表示,AI 的奖励黑客行为本质上是激励的问题,智能体会按照获得的奖励行事,这与经济学中的激励原理相同。 这一观察凸显了在 AI 系统中设计恰当激励结构以防止意外行为的重要性,将经济理论与 AI 安全和对齐研究联系起来。 该推文未提供新数据或技术分析;它反映了强化学习中众所周知的概念——奖励黑客行为源于代理利用错误指定的奖励函数来最大化奖励,而未实现预期目标。
swyx 的推文提醒工程师,他们最终会被告知分离控制平面和数据平面的重要性,并鼓励他们在职业生涯早期了解管理平面。 理解控制平面和数据平面的区别使工程师能够设计更可靠、更安全的基础设施,而早期熟悉管理平面则有助于有效的系统运行和治理。 控制平面决定路由策略和配置,数据平面执行数据包转发,管理平面负责设备配置、监控和维护;将它们分离可以提高可扩展性、安全性和容错能力。
swyx 宣布与 Akshay Nathan 一起录制播客,讨论 Codex、ChatGPT Work 达到 1000 万用户里程碑,并预测 Work + GPT 5.6 将拥有超过 10 亿用户。