Ne manquez plus aucune de nos publications :
Anthropic, une société d’IA fondée par d’anciens d’OpenAI – à l’instar de la nouvelle startup SSI d’Ilian Sutskever – le claironne haut et fort : son dernier LLM Sonnet (ou Claude 3.5) « surpasse désormais les modèles concurrents sur les évaluations clés, à deux fois la vitesse de Claude 3 Opus (son ancien modèle phare) et un cinquième du coût ». De fait, si l’on s’en tien au tableau publié par Anthropic, Claude 3.5 Sonnet fait mieux que GPT-4o, et ce dans 4 catégories sur les 6 où le LLM d’OpenAI est représenté.

Mais il y a tout de même un petit soucis, car il serait très facilement possible de manipuler à son avantage les résultats de benchs d’IA, sans compter que dans le cas présent, le LLM d’OpenAI n’est pas évalué sur 3 des 9 benchmarks. Les scores entre les deux LLMs étant particulièrement serrés, rien ne dit que que GPT-40 ne repasserait pas devant. Par exemple, GPT-40 fait nettement mieux que Claude 3.5 pour la résolution de problèmes de maths (76,6% de bonnes réponses contre 71,1% pour Claude 3.5) mais il n’y a pas de benchs GPT-40 pour la catégorie de tests « mathématique niveau études supérieures ».
Une chose semble tout de même globalement acquise, : Claude est revenu au niveau de GPT-40 dans sa version 3.5 Sonnet. De là à dire qu’il explose le LLM d’OpenAI, il y a tout de même une sacré marge….
Spider-Man: Brand New Day a franchi le seuil des 2 milliards de dollars de recettes mondiales au box-office. Le film de Sony et Marvel y est parvenu en...
Le parquet de Paris a ouvert une enquête après la cyberattaque ayant visé les impôts. Cette intrusion touche 678 000 usagers,...
Marvel a fait plusieurs annonces lors de l’événement D23 de Disney et il y a notamment eu des bandes-annonces pour Avengers: Doomsday,...
À l’occasion de l’événement D23, Disney et Lucasfilm ont dévoilé la bande-annonce pour la saison 2...
YouTube justifie la multiplication de ses changements d’interface qu’il qualifie explicitement de choix intentionnels plutôt que de...