← Back to CoursesStemExpert
StemExpert
Expert · Oplossingen · 42. Classificatie en clustering
StemExpert · Brecht Corbeel · schoolium.me
StemExpert
E42. Classificatie en clustering — oplossingen
EExpert · deel E9 · Data science en AI

Oplossingen · hoofdstuk 42Classificatie en clustering

Labels voorspellen, groepen ontdekken en de kosten van verkeerde besluiten meten

Uitgewerkte oplossingen bij de 11 opdrachten van het werkboek. Voor de leerkracht, en voor wie zichzelf wil verbeteren nadat hij het eerst zelf probeerde.

3× oefenen4× toepassen4× uitdagen± 435 min
Een sensorpatroon en een diagnose hebben verschillende bewijslast.
Een sensorpatroon en een diagnose hebben verschillende bewijslast.
Voor de leerkrachtDeze pagina bevat de antwoorden. Druk het werkboek af zonder deze pagina.
Oefenen

Oefenen

één stap, direct toepassen
42.1

Sigmoid narekenen

Oefenen6Rekenen25 min
Score z=−1,5 voor een plant.
  1. a
    Bereken p en het label bij drempels 0,5 en 0,15.
    p=1/(1+exp(1,5))=0,182426. Bij 0,5 wordt gezond voorspeld; bij 0,15 volgt een positief voorstel. De score blijft dezelfde: de actiegrens verandert.
42.2

Een confusiematrix

Oefenen6Rekenen25 min
200 planten: 20 ziek. Voorspeld ziek: 25, waarvan 15 werkelijk ziek.
  1. a
    Bereken TP, FP, FN, TN, precisie, recall en accuracy.
    TP=15, FP=10, FN=5, TN=170. Precisie=15/25=60%; recall=15/20=75%; accuracy=185/200=92,5%. De meerderheidbasislijn is 90% met recall nul.
42.3

Eén k-meansstap

Oefenen6Rekenen25 min
Punten 0, 2, 8, 10; begincentra 0 en 8.
  1. a
    Wijs toe, update centra en bereken J voor en na.
    0 en 2 gaan naar 0; 8 en 10 naar 8. Nieuwe centra 1 en 9. Voor de update J=0²+2²+0²+2²=8; daarna J=1²+1²+1²+1²=4. De volgende toewijzing verandert niet.
Toepassen

Toepassen

meerdere stappen, in een context
42.4

Gradiënt van logistiek

Toepassen7Rekenen25 min
x=2, y=0, b=0 en w=0; η=0,1.
  1. a
    Leid p−y uit kruis-entropie af en voer één stap uit.
    en , dus . Bij z=0 is p=0,5; de b-gradiënt is 0,5 en w-gradiënt 1. Nieuw b=−0,05 en w=−0,1. Nieuwe score voor dezelfde x is −0,25 en p=0,437824.
42.5

Een split vergelijken

Toepassen7Analyseren25 min
Ouder: 12 planten, 6 ziek. Split A geeft 6 met 5 ziek en 6 met 1 ziek. Split B geeft 4 met 4 ziek en 8 met 2 ziek.
  1. a
    Bereken de gewogen Gini van beide splits en kies de trainingssplit.
    Ouder-Gini=0,5. A: beide kinderen 2×(5/6)×(1/6)=0,277778, dus ook gewogen 0,277778. B: links nul, rechts 2×0,25×0,75=0,375; gewogen (8/12)×0,375=0,25. B wint op dit criterium. Minimumbladgrootte of validatie kan toch een andere inzetkeuze vragen.
42.6

Onbalans verandert precisie

Toepassen7Rekenen25 min
Recall=90%, vals-positieve fractie onder gezonde planten=5%. Vergelijk prevalentie 10% met 1%, elk op 10000 planten.
  1. a
    Bereken TP, FP en precisie voor beide populaties.
    Bij 10%: TP=900, FP=450; precisie=900/1350=66,67%. Bij 1%: TP=90, FP=495; precisie=90/585=15,38%. Dezelfde recall en vals-positieve fractie geven veel lagere precisie wanneer ziekte zeldzaam is.
42.7

Afstand en groepen testen

Toepassen7Programmeren45 min
Dezelfde plant is elke dag gemeten; vocht is in procent en ΔT in kelvin.
  1. a
    Ontwerp KNN-validatie die schaal en groepslek voorkomt.
    Splits eerst per plant of per nieuwe batch, afhankelijk van de inzetvraag. Leer gemiddelde en schaal alleen op foldtraining. Toets k op dezelfde groepsfolds; bewaar een eindgroep voor test. Bereken afstanden met die scaler, meld onbekend bereik en vergelijk een eenvoudige inspectieregel. Random dagsamples van dezelfde plant aan beide kanten geven te optimistische generalisatie.
Uitdagen

Uitdagen

transfer, open problemen, leerlijnen combineren
42.8

Drempel en kosten

Uitdagen9Ontwerpen40 min
Een inspectie kost 1 eenheid bij een gezonde plant; een gemiste ziekte kost 9.
  1. a
    Leid de theoretische kansgrens af. Waarom kies je die grens niet blind op iedere gewogen modelscore?
    Inspecteren kost (1−p), missen 9p. Inspecteer als 1−p<9p, dus p>0,1. Dit vraagt passende kosten en een gekalibreerde populatiekans. Klassegewichten en oversampling kunnen de scoreverdeling wijzigen. Kies en controleer de grens op representatieve validatie en toets kalibratie, capaciteit en kosten op een aparte groep.
42.9

Clusters onderzoeken

Uitdagen9Onderzoeken50 min
K-means geeft drie plantgroepen en het team noemt cluster 2 meteen ‘infectie’.
  1. a
    Ontwerp externe beoordeling en een gevoeligheidsproef voor deze claim.
    Neem onafhankelijk beoordeelde planten uit alle clusters, blind voor de clusternaam. Vergelijk referentielabels, cultivar, kaspositie, batch en sensorversie. Herhaal met andere starts, schalen en k; controleer stabiliteit en uitschieters. Een groep kan licht- of montageverschil zijn. Alleen aangetoonde samenhang met een onafhankelijke referentie rechtvaardigt een beperkt probleemlabel.
42.10

Zieke planten in Habitat

Uitdagen9Habitat80 min
Een classifier moet planten voor inspectie voorstellen.
  1. a
    Schrijf label-, data- en actieregels, inclusief validatie en acceptatie.
    Definieer de doelziekte en onafhankelijke referentie. Bewaar plant/batch, tijd UTC+1, feature-eenheden, kwaliteit en annotatieversie. Split per nieuwe plant en seizoen of batch, leer preprocessing binnen training, kies drempel op validatie en toets precisie/recall/aantallen op test. Een ontwerpvoorstel kan recall≥90% bij haalbare inspectielast zijn; de proef bepaalt of het haalbaar is. Het systeem stelt inspectie voor, een bevoegde operator bevestigt vervolgstappen.
  2. b
    Welke storingen en schadelijke fouten toets je?
    Toets droge gezonde planten, andere cultivars, ontbrekende meting, sensorbias, batchverschuiving en lage ziekteprevalentie. Meet gemiste zieken, onnodige inspecties, onzekerheidsmeldingen en bevestigingsvertraging. Bewaar verworpen voorstellen zodat de evaluatie geen selectiebias krijgt.
Zo wordt dit beoordeeld
referentieLabel onafhankelijk en reproduceerbaar.
evaluatieGroepssplit, onbalans en foutkosten expliciet.
actieBegrensde bevoegdheid en herstelprocedure.
42.11

Een classifier vergelijken

Uitdagen9Programmeren70 min
Breid de echte NumPy-simulatie uit met gewijzigde ziekteprevalentie en een temperatuur-offset van 1 K in een nieuwe batch.
  1. a
    Vergelijk logistiek, KNN en boom op vooraf vastgelegde grenzen. Geef een verantwoord inzetbesluit.
    Train uitsluitend op de oorspronkelijke trainingsgroep. Kies instellingen en grens op validatie; maak daarna nieuwe testbatches met andere prevalentie en offset. Rapporteer matrices, precisie, recall, foutkosten en onbekend-bereikmeldingen. Verander de modellen niet op die eindtest. Kalibratieverschuiving vraagt herstel van de meetketen of hertraining met een nieuwe apart getoetste versie; een model dat de acceptatie-eis mist blijft in schaduwmodus.
Zo wordt dit beoordeeld
uitvoeringDe drie methoden op dezelfde nieuwe groepen.
bewijsAantallen, kosten en verschuiving apart.
besluitManifest en acceptatie traceerbaar.