SWE-bench
GitHub Issueの解決能力を用いてAIのコーディング性能を測る標準テスト。
LISTENverse
拡大するとさらに表示 · 0 本
AI開発のタスク管理はGitHub Issue|リンクを渡すだけでAIが対応
超実践AI論【目次】 00:00 オープニング 00:38 AI開発と相性がいい理由 01:04 自社サイトでの実例 01:43 GitHub Issueを検討しよう 今回の内容の解説記事 https://hataracraft.com/articles/github-issue-ai-development AI・IT・業務改善の無料相談はこちら https://hataracraft.com/booking
42【圧倒的性能】Claude Fable 5のファーストインプレッション
AI駆動開発部の日常本エピソードでは、Anthropicがリリースした最新モデル「Claude Fable 5」のファーストインプレッションを共有します。Claude Fable 5は、前身モデル「Mythos」の高度な能力を引き継ぎつつ、安全面に配慮して一般公開されたモデルです。100万トークンのコンテキストウィンドウを持ち、特にSWE-bench ProやGDPval-AAといったベンチマークで飛躍的...
エピソードを読み込めませんでした。もう一度お試しください。
エピソードを読み込んでいます…