it
Her krasjer superdatamaskinene aldri
Heftig infrastruktur må til når danske forskere, leger og vindkraftnæringen vil bruke big data.
Danmarks Tekniske Universitet (DTU) i Risø har etablert et redundant system for både kjøling, fibernett og strømforsyning, slik at fremtidens superdatamaskiner kan stoppe opp.
På avstand gjør ikke containerplassen i det nordlige hjørnet av Danmarks Tekniske Universitet (DTU) i Risø særlig mye ut av seg. Men det er her noen av Danmarks største og raskeste datamaskiner driftes. Og det vil bli flere i fremtiden. De kraftige superdatamaskinene kalles HPC-klynger (High Performance Computing), og består av en rekke servere som er koblet sammen i et høyhastighetsnettverk.
Det er nemlig ikke bare danske forskere som gjerne vil ha tilgang til beregningskraft ut over det normale. Også leger i helsevesenet ønsker å ha adgang til raske og kraftige beregninger av for eksempel DNA for å kunne diagnostisere kreftpasienter.
En av HPC-klyngene som står på DTU Risøs containerområde for superdatamaskiner, er Computerome, som blant annet foretar beregninger av genom-sekvenseringer av pasienters DNA-materiale. Denne typen beregninger vil det bli behov for stadig flere av i fremtiden, og derfor er DTU også i ferd med å kjøpe inn en ny og mye kraftigere generasjon HPC-klynge – Computerome 2.0 – som har en forventet pris på 126 millioner norske kroner.
DTU Risø drifter også HPC-klyngen Jess, som brukes til beregninger av vindenergi, og Risø drifter også en backup av alle DTUs it-systemer.
- – Dette forandrer hele kjøleindustrien: Kjøleanlegget på nye Bergen lufthavn kan gå i flere døgn uten strøm (TU Ekstra)
Failure is not an option
I takt med at det ikke bare er forskningsresultater som skal beregnes, men også kliniske helsedata som brukes til diagnostikk, er det ikke rom for at infrastrukturen på serverplassen feiler.
Derfor har it-avdelingen for forskning på DTU Risø ved Roskilde i løpet av de siste årene jobbet intensivt med å etablere en infrastruktur til å drive fremtidens danske superdatamaskiner.
– Oppgaven vår er i hovedsak å levere mest mulig datakraft per krone, altså flest mulig beregninger til lavest mulig pris. Men i takt med at HPC-anleggene våre også må beregne kliniske data fra blant annet regionene på for eksempel Computerome 2.0, blir oppetid også et parameter, og det har vi jobbet ganske intensivt med i løpet av det siste året, forteller Michael Rasmussen, som er leder av forsknings-it-seksjonen på DTU.
– Vi har en et belegg på opp mot 90 prosent på de HPC-anleggene som vi drifter her nede, og interessen bare øker, sier Michael Rasmussen.
Redundans på alle systemer
Når man gjerne vil ha det slik at serverne kan kjøre uforstyrret videre uansett hva som skjer, må det etableres en redundant infrastruktur. Og det er dette som DTU Risø har jobbet med det siste året.
– Vi har brukt – og bruker fremdeles – mye tid og mange ressurser på å gjøre infrastrukturen her på DTU Risø redundant, uansett hvor i systemet du er. Hvis vi har en feil et sted, kan vi kjøre uforstyrret videre. Vi har skaffet oss et redundant kjølesystem i serverrommet vårt, og vi har fått en redundant strømforsyning, slik vi har to separate 230 kV-strømforsyninger; fra Jyllinge nordpå og sørpå fra Roskilde, samtidig som vi har fått redundant fibernett på hele campusområdet vårt, sier Bent Bøgelund Hansen, som står for det fysiske vedlikeholdet av HPC-anleggene på DTU Risø.
I takt med at Computerome 2.0 kommer til å gjøre det mulig å øke mengden av data som skal beregnes, blir tid også en kritisk faktor. Det er blant annet også derfor at man har etablert flere 100 GB-fiberforbindelser som er dedikert til Computerome 2.0.
Fibernettverksringen er lagd for å sikre at it-infrastrukturen bak de store forskningsfasilitetene på DTU Risø fortsatt er operative, selv om det oppstår en feil et sted i systemet.
I tillegg til Computerome-installasjonene omfatter forskningsfasilitetene på DTU campus Risø også vindtunnelen Poul la Cour og Large Scale Facility, som benyttes til storskala-tester av vindmøllevinger.
Fibernettverksringen, som består av hårtynne såkalte single mode-lysledere, utgjør forbindelsen mellom to datasentre på DTU Risø. Lyslederne sørger for at data kan overføres raskt over store avstander.
- Norsk gjennombrudd i spinnstrøm-teknologien: Kan gi oss datamaskiner som knapt bruker strøm
Ingen dieselgeneratorer
Redundans i datasentre blir vanligvis målt etter det såkalte Tier-rating-systemet, som opererer med fire nivåer av pålitelighet i et datasenter; fra det laveste nivået, én, til det høyeste, som er nivå fire. Deler av serverplassen på DTU Risø forblir på nivå tre, hvor det er krav om en oppetid på 99,982 prosent, og hvor du ikke kan ha mer enn 96 minutters nedetid fordelt over et helt år.
Her skal du også kunne foreta vedlikehold av systemet uten at det blir avbrudd i HPC-klyngenes beregninger. Men hele serverplassen vil ikke komme opp på dette høye sikkerhetsnivået.
– Ambisjonen vår er å drifte kraftige, men også skalerbare regne-anlegg med så lave kostnader som mulig, og hvor man – svært forenklet – kommer med en container med servere, en strømkontakt, en nettverkskontakt og en vanntilkobling. Det innebærer også at det vil bli for dyrt hvis hele serverplassen skulle vært konstruert for Tier-3 nivå, hvor alle systemene er redundante, men uten krav om fortsatt drift under vedlikehold, sier Bent Bøgelund Hansen.
Du kan for eksempel ikke finne en nødstrømgenerator som drives av diesel på DTU Risø. Det skyldes ifølge Michael Rasmussen at den den danske forsyningsinfrastrukturen allerede i dag er ekstremt stabil og pålitelig.
– Det har vi valgt bort, fordi vi har adgang til to separate 132 kV- høyspentkilder. Hvis begge slutter å fungere, er Sjælland ganske enkelt uten strøm, og dermed blir vi nok også tilgitt for at vi stopper beregningene, forteller Michael Rasmussen.
Michael Rasmussen og Bent Bøgelund Hansen blir ivrige når de viser fram litt av det sist innkjøpte maskinvaren: en ny strømtavle i et lite anonymt lokale. Den sørger for at superdatamaskinene kan regne videre selv om strømmen går.
– Denne strømtavlen er vår helt store stolthet for tiden. Den gjør kanskje ikke mye ut av seg, men den er spesialkonstruert for oss, og ble forholdsvis dyr. Strømtavlen består av en primær og en sekundær forsyning, så hvis det blir avbrudd i strømforsyningen nordfra i Jyllinge, hvor den vanligvis kommer fra, vil den automatisk bytte over til Roskilde, sier Michael Rasmussen.
- Målet er en omsetning på 4 milliarder: De har utviklet flygende superdatamaskiner som skal inspisere strømnettet (TU Ekstra)
Plass til å oppskalere
– Vi kan selv bestemme hvor raskt overgangen skjer, fordi hullet blir dekket av nødstrømsforsyningen vår. Så de beregningene som kjører på HPC-klyngen, blir ikke forstyrret. For tiden bruker vi ett minutt på overgangen, for å sikre at kjøleanlegget stopper opp og starter greit opp igjen. For hvis vi foretar et for raskt bytte, kan controlleren gå helt i stå, forteller Michael Rasmussen.
I tillegg til life science-superdatamaskinen Computerome og DTU Vindenergis nye HPC-klynge, kjører også Landstrafikmodellen fra serverplassen, og det er plass til flere superdatamaskiner på området, som har eksistert i omkring tre år.
– Vi har installert 5 MW strøm, og det jobbes med en ny transformatorstasjon for å øke det tallet, så vi er godt rustet til å oppskalere.
- Elbiler og solceller krever mer av strømforsyningen: Det håper Lyse å løse ved et smartere nett (TU Ekstra)
Virtualisering gir færre HPC-anlegg
Det er ikke bare behovet for økende beregningskraft som gjør det fornuftig å samle superdatamaskiner. Den teknologiske utviklingen av HPC-klynger gjør det også enklere og mer opplagt å sentralisere datakraft på færre geografiske områder.
Tradisjonelt har de ulike HPC-klyngenes superdatamaskiner vært bygd spesifikt til de applikasjonene som forskerne har behov for. Derfor har DTU Fysik, i likhet med DTU Vindenergi, sin egen superdatamaskin, mens de på Syddansk Universitet bruker superdatamaskinen Abacus 2.0 til svært nøyaktige kvantemekanisk baserte beregninger.
– De forskjellige forskningsanleggene har forskjellige behov. Det er veldig avhengig av hvilket problem du skal regne på; om det er minnet, forbindelsen utenfra eller en tredje faktor som kan gi flaskehalsproblemer. Vindforskerne på DTU Vindenergi har for eksempel behov for å få det raskest mulige nettverket til sine parallelle Computational Fluid Dynamics-beregninger, mens DTU Fysik har andre krav. Derfor har det inntil videre også vært fornuftig å ha HPC-klyngene plassert fysisk ute i forskningsmiljøene, men det tror jeg endrer seg i fremtiden, sier Michael Rasmussen.
I dag er det nemlig mulig å virtualisere applikasjonene, uten at det går voldsomt ut over yteevnen til superdatamaskinene.
Det kommer antakelig til å endre på den HPC-infrastruktur som finnes i Danmark og Europa i dag.
– I dag kan du lage en virtualisering som bare koster to prosent i yteevne. Så jeg tror at utviklingen beveger seg mot at du har en fysisk HPC-klynge med den størst mulige samlingen av svarte bokser – altså servere – stående, med det raskeste nettverket, og så legger du alle applikasjonene dine på toppen med en virtualisering. Det innebærer at du i fremtiden ikke vil se anlegg som i like stor grad er bygd og installert spesifikt til bestemte forskningsområder, men snarere at HPC-klyngene kan brukes til mange forskjellige formål og dermed utnyttes bedre. I tillegg blir det i høyere grad de veldig store mengdene av data som vil avgjøre hvor beregningskraften plasseres, sier Michael Rasmussen.
Grønne løsninger
Debatten om datasentrenes energiforbruk har blitt mer aktuell i forbindelse med at store teknologi-giganter som Facebook og Apple har foretatt de første spadetakene for bygging av flere hyperskala-datasentre.
– Det koster penger, mange penger, å drive denne typen HPC-klynger rent energimessig. Faktisk er driftsomkostningene til kjøling og strøm like store som det å kjøpe inn selve maskinvaren og programvaren, og utstyret må byttes omtrent hvert femte år. Så vi jobber mye med å legge inn grønne løsninger. Vi har for eksempel etablert varmegjenvinning, slik at vi kan bruke opptil 25 prosent av restvarmen fra datamaskinene i fjernvarmeanlegget vårt. Det er viktig at vi ikke bare bevisstløst glemmer CO2-utslippene, sier Bent Bøgelund Hansen.
Når så mange servere er dyttet inn på så liten plass, trengs det kjøling. Til å begynne med brukes det frikjøling, altså uteluft, så langt som det er mulig, før man går over til kompressorkjøling, som er vesentlig mer energikrevende.
Sommeren 2018 ble det stadig vekk satt varmerekorder, og det kunne også merkes i serverrommene ved DTU Risø.
– Vi var presset på flere områder. Når temperaturen er over 30 grader utendørs, kreves det litt for å kjøle serverrommene innvendig. Spesielt hadde noe av den eldre maskinvaren en tøff kamp med varmen i sommer, mens de nyere serverne våre kan klare over 30 grader i innsugningstemperatur, sier Michael Rasmussen.
Artikkelen ble først publisert bak betalingsmur hos Ingeniøren.dk, og gjøres tilgjengelig for abonnenter av TU Ekstra gjennom vår samarbeidsavtale.
- Flytende sol-eksplosjon: – Dette vil knuse alt på pris (TU Ekstra)