OpenScienceが科学エージェントベンチマークでトップに、30以上のモデル統合と新IDEを公開
日本語参考訳
Synthetic SciencesはオープンソースのOpenScienceエージェントを公開し、エージェント型科学ベンチマークでCodexやClaude Codeを上回りました。 任意のプロバイダーのモデルに対応した無料のApache 2.0ワークベンチです。 スタンフォード大学とLaude InstituteがホストするTerminal-Bench-Scienceの70の研究ワークフローでは、OpenScienceが75.7%で53のタスクを解決しました。 GPT-6 Astraを用いたCodexは、公開リーダーボードのSeptember 23ミラーで68.1%の最高得点を記録しました。 Terminal-Bench 4.0の14の科学タスクでは差が広がり、OpenScienceは71.4%、Claude Fable 5.1上のClaude Codeは60.0%に達しました。 GitHubリンクはコメントにあります。
AINNでは投稿本文・投稿者本人の追記・第三者コメントの全文転載を避け、X公式埋め込みと元投稿への導線を中心に表示します。
AIによる見どころ整理
何について
Synthetic Sciencesが提供するオープンソースのOpenScienceエージェントは、StanfordとLaude InstituteがホストするTerminal-Bench-Scienceの70の研究ワークフローで75.7%の課題解決率を達成し、CodexやClaude Codeを上回っています。新たに製品版となり、再設計された研究用IDEや30以上のモデルを統合したウォレット機能、独自のAutoresearch機能などを備え、30以上の大学や研究所で利用されています。
なぜ注目
OpenScienceの成功は、複数のAIモデルを統合した研究用ワークベンチとして実績を示した点にあります。特にStanfordなどが関与する科学課題ベンチマークで高いスコアを獲得し、利用の広がりや機能拡張が注目されます。
🔰 初学者向け要約
OpenScienceは研究のためのAIエージェントで、科学分野の多数の課題を解決する能力が高いことが確認されました。新しい使いやすい開発環境や多くのAIモデルをひとまとめにした機能を備え、世界中の大学や研究所で活用されています。
用語を調べる
公開記事とWeb上の出典をもとに、Geminiが短く説明します。1日5回まで利用できます。
