AI for trafiksikkerhed
Sprogmodeller og topic modelling til analyse af trafikdata
DOI:
https://doi.org/10.54337/ojs.td.v33i.11687Sammendrag
Politiets uheldsregistrering indeholder både strukturerede variable og en fritekstbeskrivelse om uheldet. Fritekstbeskrivelserne rummer detaljer, som de strukturerede felter ikke fanger, men de bruges i dag næsten kun ved manuel gennemgang. Denne artikel undersøger, om åbne, domænetilpassede sprogmodeller kan gøre de danske fritekstbeskrivelser mere anvendelige i uheldsanalysen. Vi opstiller to analytiske spor baseret på 898.677 politiskrevne fritekstbeskrivelser fra Vejdirektoratets uheldsdatabase (Vejman): en dansk BERT-model, der klassificerer uheldssituationen, og en BERTopic-model, der grupperer fritekstbeskrivelserne efter betydning. Klassifikationen opnår en nøjagtighed på 85,8 % og en makro-F1 på 83,5 %, hvilket viser, at fritekstbeskrivelserne rummer information om uheldet, og at modellen kan
genskabe den registrerede uheldstype ud fra teksten alene. Emnemodelleringen afdækker mønstre, der kan understøtte validering af dataene i politirapporten, berige brede uheldskategorier og identificere nye mønstre, som de eksisterende strukturerede felter ikke fanger, herunder flugtuheld. Resultaterne peger på, at teksterne kan supplere de strukturerede data, ikke erstatte dem, i et lokalt miljø, der kører på ens egen computer og imødekommer databeskyttelseskravene.