斯坦福临床医疗AI横评,DeepSeek把谷歌OpenAI都秒了
31页论文最终得出,DeepSeek R1、o3-mini、Claude 3.7 Sonnet等在内的9个前沿大模型,DeepSeek R1以66%胜率、0.75宏观平均分领先。
31页论文最终得出,DeepSeek R1、o3-mini、Claude 3.7 Sonnet等在内的9个前沿大模型,DeepSeek R1以66%胜率、0.75宏观平均分领先。
这一成绩不仅刷新了国内AI模型在国际多模态测评中的最高得分纪录,更超越谷歌、OpenAI等全球顶尖团队,与商汤科技SenseNova(80.4分)、上海AI LAB InternVL(79.1分)占据前10名的半壁江山,展现了中国在通用人工智能领域的突破性进展
这一成绩不仅刷新了国内AI模型在国际多模态测评中的最高得分纪录,更超越谷歌、OpenAI等全球顶尖团队,与商汤科技SenseNova(80.4分)、上海AI LAB InternVL(79.1分)占据前10名的半壁江山,展现了中国在通用人工智能领域的突破性进展