蝶动洞察Flutter Insight

双重用途生物学基准解读:用 IRT 与分类法透视前沿 AI 的生物能力与饱和趋势(2026年 57页)

分类:研究报告

标签:前沿AI、生物安全、基准测试

摘要:兰德公司(RAND)于 2026 年发布的这份研究,旨在回应一个核心问题:现有双重用途(dual-use)生物学基准数据,究竟能揭示前沿人工智能(AI)在生物知识与问题解决上“现在能做到而过去做不到”什么。报告并未推出新基准,而是对既有纵向基准数据做一次“元评估”,提出一套解读框架,以更清晰地理解基准分数背后的能力、覆盖与质量含义。 报告将 26 个基准、共 8,146 道题目(item)汇聚为单一语料库,涵盖公开与 SecureBio 私有基准(包括病毒学能力测试 VCT、人类病原体能力测试 HPCT、分子生物学能力测试 MBCT),并对 49 个前沿 AI 模型(剔除覆盖率低于 75% 的 4 个后余 45 个)的答题数据,连同专家基线一并分析。方法论上采用项目反应理论(IRT,二参数 logistic 模型),以统一 logit 尺度估计解题者能力 θ、题目难度 β 与区分度 α,使不同模型、题目与专家可在同一标尺上直接比较。 主要发现如下。其一,基准并非全面饱和:大量题目对前沿模型已较容易,饱和集中在低难度区间,但仍有少量高难度、高区分度的题目超出当前模型能力,并能持续区分

来源:zuudee | 日期:2026-08-11 | 格式:pdf | 页数:57

加载中...