Ce projet nécessite d'avoir assimilé l'ensemble des notions du premier module du cours de science des données biologiques III. Il correspond au dépôt GitHub https://github.com/BioDataScience-Course/C01Ib_lda et est distribué sous licence CC BY-NC-SA 4.0.
Ce projet est individuel, court et cadré. Vous devrez :
- créer un classifieur
- tester ce classifieur
- utiliser les métriques de performance
-
Complétez les zones manquantes dans le carnet de notes
biodeg_notebook.qmd. -
Assurez-vous à la fin que vous pouvez compiler une version HTML du fichier
biodeg_notebook.qmd(bouton 'Rendu') sans erreurs. Sinon, corrigez-les avant soumission finale. N'utilisez pas l'argumentecho=FALSEdans vos chunks. Le code R qui génère les résultats doit rester visible dans la version HTML. -
Utilisez les outils de vérification mis à votre disposition (onglet 'Construire' -> bouton 'Construire tout') toujours après avoir refait un rendu du document sinon, les informations présentées dans les tests ne seront pas à jour.
-
Enfin, vérifiez que votre dernier commit + push est bien enregistré sur GitHub à la fin de l'exercice.
Dans le cadre de votre travail, vous pouvez utiliser l’intelligence artificielle. Il est toutefois impératif de préciser, dans la section « Matériel et méthodes » du projet, que l’IA a été utilisée, en indiquant le contexte et la manière dont elle a été employée. Voici un exemple de formulation :
La relecture (orthographe et syntaxe) a été réalisée à l’aide de Microsoft Copilot (basé sur GPT-5), consulté le 12 janvier 2026.
Attention, vous devez néanmoins employer le dialecte SciViews-R afin de garantir votre compréhension du cours de Science des données biologiques 2 lors de la production de code R dans votre projet.
Un chatbot SciViews est également disponible dans RStudio (Saturn Cloud), via l’addin Help. Il répond aux questions relatives au langage R, aux statistiques et à la science des données.
Les données et les métadonnées sont à disposition sur le site de l'UC Irvine Machine Learning Repository :
Elles ont été employées dans le cadre de la publication suivante :