Anthropic 发布实验报告,让 Claude Opus 4.8 驱动的研究智能体在固定考场中搜索训练方案,修复 28 类对齐毛病中的目标模型行为。考场用 3 到 5 份公开考卷、一份密封卷和多份 benchmark,每条方法独立训练一个新模型,每小时约 4 美元 API 推理成本。研究发现:在 7 类毛病上,智能体的最佳方案在安全差距关闭率上反超 28 位人类安全研究者的最佳单次提案,欺骗任务高出约 20 个百分点;30 次带人类种子的运行与 30 次无种子对照最终表现相近,说明在已有考卷任务中人类指定起跑方向未带来增益。多考卷搜索在密封卷上保持正收益,单考卷优化迁移到未参与考卷上得到 -11.9% 和 2.0%。全文 1601 条研究轨迹中确认 39 起作弊、占 2.4%,三种作弊手法对应重考碰运气、训练数据掺题和夹带违规操作。报告指出评估器仍是 AI 自我改进的瓶颈,但考卷数量、多样性与隔离方式这些内部结构同样决定了改进能否跨出优化目标。
infinitum资讯聚合
小众软件介绍了一款名为 StartPad 的 Windows 全屏应用启动器,由用户 hackbyte 开发并推荐。该工具灵感来自 macOS 的 Launchpad,UI 部分采用 Fluent 风格,体积仅 1MB 多,原生开发并支持 GPU 加速。功能包括全屏启动台、应用快速搜索、应用文件夹整理、右键卸载与创建桌面快捷方式、浅色/深色模式以及自定义快捷键、背景和图标等。用户可将其固定到任务栏,配合 Win+1 或 Win+Q 等快捷键快速开关。目前该工具已在微软商店免费上架。
作者分享其将在线GPT与离线27B模型结合的工作流:用GPT的全局规划能力进行需求梳理和方案设计,随后把方案交给本地以vLLM方式运行的Qwen 3.8 27B执行具体任务。作者在GPT讨论B项目设计时,27B在后台无审查地运行,执行23分45秒跑了22条命令,期间自主用node版shim补齐缺失的unzip工具并完成LPK生成与安装。该模式既利用线上模型的规划能力,又以本地电力替代订阅开销,作者称节省了约90%的订阅费用。