Aller au contenu
La Lettre IT
Toutes les rubriques

IA & modèles

Modèles, agents, entraînement et évaluation, avec ce que les annonces valent une fois en production.

3 synthèses dans cette rubrique.

3 min de lecture
IA & modèles

L'IA surpasse désormais certains des meilleurs prévisionnistes humains

En bref

  • Un article de l'Economist affirme que l'IA dépasse certains des meilleurs prévisionnistes humains en capacité de prédiction.
  • Les commentaires HN soulignent plusieurs biais méthodologiques : analysts actuels se trompent déjà 53% du temps (pire qu'un tirage au sort), et les contests de prévision peuvent être remportés par effet statistique pur avec peu de prévisionnistes différents.
  • Le débat remet en question la robustesse de cette comparaison et les limites de l'IA face à des systèmes dynamiques complexes comme les marchés financiers.

Dans les commentaires

Débat partagé, avec scepticisme majoritaire sur la solidité méthodologique et les implications réelles.

Notre lecture

Intéressant méthodologiquement, mais sans conséquence immédiate pour les DSI. Le résultat repose sur des comparaisons fragiles (analystes humains plutôt mauvais, biais statistiques d'un contest, absence d'effet de réflexivité testé). Si l'IA surpasse effectivement en prévision, c'est surtout parce que la barre est basse et que l'historique est stable. L'intérêt réel n'est pas l'IA qui prédit mieux, mais le risque systémique que représente l'adoption massive d'IA corrélées dans des marchés dynamiques, et ce risque reste largement inexploré dans le fil. À surveiller pour les implications en cybersécurité et résilience des marchés, mais pas d'action directe court terme.

Lire la synthèse
4 min de lecture
IA & modèles

Utiliser les LLM comme features plutôt que classifieurs directs

En bref

  • Un LLM utilisé directement pour classer des données souffre de problèmes d'étalonnage, de seuils mal contrôlables et d'interprétabilité insuffisante.
  • La meilleure approche consiste à traiter la sortie du LLM comme une feature d'entrée pour un classifieur classique (régression logistique, XGBoost).
  • Cette approche hybride retrouve les propriétés attendues d'un bon modèle : calibration, intégration de données structurées, et interprétabilité du processus décisionnel.

Dans les commentaires

Débat partagé : le fil se divise entre ceux qui valident l'approche (utilisateurs en production confirmant qu'elle fonctionne bien) et ceux qui jugent l'article peu novateur ou qui proposent des améliorations au LLM directement plutôt qu'un changement d'architecture.

Notre lecture

L'article décrit une approche pragmatique et reconnue en pratique : traiter un LLM comme extracteur de features plutôt que comme classifieur final retrouve les propriétés ML usuelles. C'est particulièrement utile si vous avez des données structurées à intégrer ou si vous avez besoin de contrôler précision/rappel. En revanche, l'article sous-estime le coût réel : vous n'échappez pas à l'étiquetage manual (construire un jeu d'entraînement pour la régression logistique). Et l'idée de combiner un modèle simple sur les sorties d'un modèle complexe n'est pas nouvelle, même si sa systématisation ici pour les LLM a du mérite. À tester en production si vous cherchez à maîtriser votre pipeline de classification, mais pas une révélation conceptuelle. Le débat HN soulève aussi qu'une meilleure ingénierie du prompt direct (incorporer les critères dans la promulgation) pourrait suffire et éviter la complexité ajoutée.

Lire la synthèse
3 min de lecture
IA & modèles

Skillbay : une place de marché de compétences pour agents IA, curée manuellement

En bref

  • Skillbay propose un répertoire curé de « skills » (fichiers SKILL.md) que les agents IA peuvent installer pour améliorer leurs capacités sur des tâches spécifiques.
  • Chaque skill est révisé par une personne et inclut des exemples avant/après montrant son impact.
  • La plateforme fonctionne en API ouverte et MCP (Model Context Protocol), avec des skills gratuits et payants.

Dans les commentaires

Débat partage et sceptique : un quart des commentaires soulignent l'absence de moat concurrentiel et questionnent la valeur d'acheter du markdown, un quart reconnaît l'utilité potentielle d'une curation manuelle pour la confiance, un quart ignore la proposition ou la détourne en blague.

Notre lecture

L'idée d'un répertoire curé de skills résout un vrai point de friction : la confiance et la réutilisabilité face à une génération ad hoc. Mais la curation manuelle ne crée pas un moat durable si les skills sont du markdown et du code. Le vrai test sera de savoir si des équipes d'IA préfèrent payer pour une skill validée plutôt que de la générer ou de la copier. Intéressant pour surveiller comment le marché tranche entre confiance et coût, mais trop tôt pour conclure sur la viabilité du modèle économique. À suivre surtout si des cas d'usage métier se dégagent (data pipelines, workflows sales, etc.).

Lire la synthèse