Oplossingen · hoofdstuk 42Classificatie en clustering
Labels voorspellen, groepen ontdekken en de kosten van verkeerde besluiten meten
Uitgewerkte oplossingen bij de 11 opdrachten van het werkboek. Voor de leerkracht, en voor wie zichzelf wil verbeteren nadat hij het eerst zelf probeerde.
Bereken TP, FP, FN, TN, precisie, recall en accuracy.
TP=15, FP=10, FN=5, TN=170. Precisie=15/25=60%; recall=15/20=75%; accuracy=185/200=92,5%. De meerderheidbasislijn is 90% met recall nul.
42.3
Eén k-meansstap
Oefenen6Rekenen25 min
Punten 0, 2, 8, 10; begincentra 0 en 8.
a
Wijs toe, update centra en bereken J voor en na.
0 en 2 gaan naar 0; 8 en 10 naar 8. Nieuwe centra 1 en 9. Voor de update J=0²+2²+0²+2²=8; daarna J=1²+1²+1²+1²=4. De volgende toewijzing verandert niet.
Toepassen
Toepassen
meerdere stappen, in een context
42.4
Gradiënt van logistiek
Toepassen7Rekenen25 min
x=2, y=0, b=0 en w=0; η=0,1.
a
Leid p−y uit kruis-entropie af en voer één stap uit.
dL/dp=−y/p+(1−y)/(1−p) en dp/dz=p(1−p), dus dL/dz=p−y. Bij z=0 is p=0,5; de b-gradiënt is 0,5 en w-gradiënt 1. Nieuw b=−0,05 en w=−0,1. Nieuwe score voor dezelfde x is −0,25 en p=0,437824.
42.5
Een split vergelijken
Toepassen7Analyseren25 min
Ouder: 12 planten, 6 ziek. Split A geeft 6 met 5 ziek en 6 met 1 ziek. Split B geeft 4 met 4 ziek en 8 met 2 ziek.
a
Bereken de gewogen Gini van beide splits en kies de trainingssplit.
Ouder-Gini=0,5. A: beide kinderen 2×(5/6)×(1/6)=0,277778, dus ook gewogen 0,277778. B: links nul, rechts 2×0,25×0,75=0,375; gewogen (8/12)×0,375=0,25. B wint op dit criterium. Minimumbladgrootte of validatie kan toch een andere inzetkeuze vragen.
42.6
Onbalans verandert precisie
Toepassen7Rekenen25 min
Recall=90%, vals-positieve fractie onder gezonde planten=5%. Vergelijk prevalentie 10% met 1%, elk op 10000 planten.
a
Bereken TP, FP en precisie voor beide populaties.
Bij 10%: TP=900, FP=450; precisie=900/1350=66,67%. Bij 1%: TP=90, FP=495; precisie=90/585=15,38%. Dezelfde recall en vals-positieve fractie geven veel lagere precisie wanneer ziekte zeldzaam is.
42.7
Afstand en groepen testen
Toepassen7Programmeren45 min
Dezelfde plant is elke dag gemeten; vocht is in procent en ΔT in kelvin.
a
Ontwerp KNN-validatie die schaal en groepslek voorkomt.
Splits eerst per plant of per nieuwe batch, afhankelijk van de inzetvraag. Leer gemiddelde en schaal alleen op foldtraining. Toets k op dezelfde groepsfolds; bewaar een eindgroep voor test. Bereken afstanden met die scaler, meld onbekend bereik en vergelijk een eenvoudige inspectieregel. Random dagsamples van dezelfde plant aan beide kanten geven te optimistische generalisatie.
Uitdagen
Uitdagen
transfer, open problemen, leerlijnen combineren
42.8
Drempel en kosten
Uitdagen9Ontwerpen40 min
Een inspectie kost 1 eenheid bij een gezonde plant; een gemiste ziekte kost 9.
a
Leid de theoretische kansgrens af. Waarom kies je die grens niet blind op iedere gewogen modelscore?
Inspecteren kost (1−p), missen 9p. Inspecteer als 1−p<9p, dus p>0,1. Dit vraagt passende kosten en een gekalibreerde populatiekans. Klassegewichten en oversampling kunnen de scoreverdeling wijzigen. Kies en controleer de grens op representatieve validatie en toets kalibratie, capaciteit en kosten op een aparte groep.
42.9
Clusters onderzoeken
Uitdagen9Onderzoeken50 min
K-means geeft drie plantgroepen en het team noemt cluster 2 meteen ‘infectie’.
a
Ontwerp externe beoordeling en een gevoeligheidsproef voor deze claim.
Neem onafhankelijk beoordeelde planten uit alle clusters, blind voor de clusternaam. Vergelijk referentielabels, cultivar, kaspositie, batch en sensorversie. Herhaal met andere starts, schalen en k; controleer stabiliteit en uitschieters. Een groep kan licht- of montageverschil zijn. Alleen aangetoonde samenhang met een onafhankelijke referentie rechtvaardigt een beperkt probleemlabel.
42.10
Zieke planten in Habitat
Uitdagen9Habitat80 min
Een classifier moet planten voor inspectie voorstellen.
a
Schrijf label-, data- en actieregels, inclusief validatie en acceptatie.
Definieer de doelziekte en onafhankelijke referentie. Bewaar plant/batch, tijd UTC+1, feature-eenheden, kwaliteit en annotatieversie. Split per nieuwe plant en seizoen of batch, leer preprocessing binnen training, kies drempel op validatie en toets precisie/recall/aantallen op test. Een ontwerpvoorstel kan recall≥90% bij haalbare inspectielast zijn; de proef bepaalt of het haalbaar is. Het systeem stelt inspectie voor, een bevoegde operator bevestigt vervolgstappen.
b
Welke storingen en schadelijke fouten toets je?
Toets droge gezonde planten, andere cultivars, ontbrekende meting, sensorbias, batchverschuiving en lage ziekteprevalentie. Meet gemiste zieken, onnodige inspecties, onzekerheidsmeldingen en bevestigingsvertraging. Bewaar verworpen voorstellen zodat de evaluatie geen selectiebias krijgt.
Zo wordt dit beoordeeld
referentie
Label onafhankelijk en reproduceerbaar.
evaluatie
Groepssplit, onbalans en foutkosten expliciet.
actie
Begrensde bevoegdheid en herstelprocedure.
42.11
Een classifier vergelijken
Uitdagen9Programmeren70 min
Breid de echte NumPy-simulatie uit met gewijzigde ziekteprevalentie en een temperatuur-offset van 1 K in een nieuwe batch.
a
Vergelijk logistiek, KNN en boom op vooraf vastgelegde grenzen. Geef een verantwoord inzetbesluit.
Train uitsluitend op de oorspronkelijke trainingsgroep. Kies instellingen en grens op validatie; maak daarna nieuwe testbatches met andere prevalentie en offset. Rapporteer matrices, precisie, recall, foutkosten en onbekend-bereikmeldingen. Verander de modellen niet op die eindtest. Kalibratieverschuiving vraagt herstel van de meetketen of hertraining met een nieuwe apart getoetste versie; een model dat de acceptatie-eis mist blijft in schaduwmodus.