03-01-2026 14:58:57
Merci, je vais regarder ça
Sciences - Partage - Entraide
|
Plier dans les nuages avec vast.ai
|
|
03-01-2026 22:03:18
En effet, merci pour ton analyse c'est bon à savoir.
Préconisation d'ajouter dans le template un Extra filter
Code : disk_bw>=500Ce critère permet de filtrer les instances qui ont un stockage peu rapide (< 500 Mo/s) ... sinon, l'instance prendra plus de temps à être créée et cela impactera aussi négativement la lecture/écriture sur disque des WU récupérées, des checkpoints pendant le calcul et des résultats à envoyer
Merci
Si vous utilisez des instances VAST avec plus d'un GPU, vous pourriez rencontrer des problèmes de stockage et l'arrêt/blocage de l'instance, avec un message d'erreur, comme ci-après, sur la "carte d'identité" VAST de votre instance :
Donc avec ces fichiers + la taille de la WU + Logs + ..., on atteint vite 4 Go de données par GPU ! Et avec 2 GPU et 2 p18261, le stockage recommandé de 8Go de l'instance peut être saturé... Même si la visualisation est désactivée coté client web (vous pouvez voir la ligne dans la log de votre client) , les fichiers sont hélas toujours générés ! J'ai créé un ticket pour le dév. : https://github.com/FoldingAtHome/fah-cli...issues/419 En attendant que cela soit résolu, et si vous souhaitez utiliser ce type d'instance multi-GPU (x2, x4, x8 ou plus) , je vous recommande d' ajouter ces 3 lignes au début de la zone texte "Bash commands that are invoked whenever your instance starts, see FAQ/Docs for details." Code : curl https://raw.githubusercontent.com/JWhyFR/fah-v8/main/cleanup_viewer.sh -o cleanup_viewer.shCela lancera en tâche de fond, sur votre instance, une purge automatique toutes les 30 secondes de ces fichiers, s'ils font plus de 1 Mo ... et évitera ainsi à votre instance de planter. (vous pouvez aussi ajouter ces 3 lignes par sécurité, même si vous ne prenez que des instances avec 1 GPU... ça n'aura pas d'impact négatif, et permettra d'anticiper un prochain problème le jour où ces fichiers de visualisation feront 80+ Mo )NB: bien évidemment, avec la purge de ces fichiers, la visualisation ne sera plus fonctionnelle dans le client web.
Je copie/colle ici ce que j'ai mis en bas de ce message : https://forum.alliancefrancophone.org/sh...5#pid15495
Citation :Joseph a fait un refresh de tous les tokens des utilisateurs.
Pas indispensable, mais si vous souhaitez avoir qq infos sur le réseau et le GPU (et notamment un potentiel bridage) visibles dans l' "instance log", vous pouvez ajouter au début du texte dans la zone "Bash commands that are invoked whenever your instance starts, see FAQ/Docs for details."
Code : SPEED_TEST=$(cat <<EOFExemple de résultat (sur une instance avec un GPU bridé) : Code : ==========================================Edit du 29/03: Alternativement (donc en remplacement du code mis plus haut) , vous pouvez utiliser ce script (ajouter au début du texte dans la zone "Bash commands that are invoked whenever your instance starts, see FAQ/Docs for details." Code : curl https://raw.githubusercontent.com/JWhyFR/fah-v8/main/fah-monitoring.sh -o fah-monitoring.sh && chmod +x fah-monitoring.sh- les infos GPU, toutes les 30mn - les résultats du speedtest, toutes les 12h (vu que ça peut consommer pas mal de réseau, selon votre bande passante, c'est pour éviter que la facture "internet" de l'instance explose )exemple des 2 types d'info, récupéré de l'instance log : Code : ============================================
Avec l'augmentation des prix des instances chez VAST, l'extra filter
Code : dlperf_per_dphtotal>300et potentiellement l'extra filter Code : dph_total<0.4pourraient vous empêcher de trouver des instances dans l'écran de recherche VAST. Si vous n'avez plus aucun instance visible dans les résultats de recherche et que vous utilisez ces Extra filters dans votre template, je vous préconise de supprimer ce premier critère dlperf_per_dphtotal (et éventuellement ajuster le dph_total en fonction de ce que vous êtes prêt à mettre, au max.) , et, dans l'écran de recherche d'instance, utiliser le tri "Price (inc)" ou "DLPerf/$/Hr" (dans la liste déroulante la plus à droite) pour trouver la "bonne" instance. ![]() (et merci au breton têtu pour l'échange du jour qui a permis d'identifier ce souci 🙏)
06-06-2026 13:05:21
Je limite les prix à 0.25 ... et y'a plus grand chose
Suite à une mésaventure avec une instance Vast.ai (tarif GPU pas cher, mais tarif réseaux dans la moyenne haute, mais surtout un script qu'avait mis en place le loueur pour télécharger automatiquement en boucle 20 Go d'ISO Linux !) j'ai fait un nieme script de monitoring... pour le réseau cette fois ci !
fah-netmon.sh Ce script surveille en temps réel la consommation réseau (DL/UL) sur l'interface réseau principale. Il enregistre l'historique minute par minute sur une fenêtre glissante d'une heure pour déclencher des alertes en cas de pic de trafic, avec une période de grâce (cooldown) pour éviter leurs répétitions. Il effectue un premier contrôle rapide après 3 minutes d'exécution, suivi d'un rapport synthétique toutes les heures. Seuils par défaut (paramétrables dans la ligne de commande): - 5 min : 200 Mo - 20 min : 300 Mo - 60 min : 400 Mo Utilisation dans un template Vast.ai : Pour exécuter le script en arrière-plan et rediriger ses logs directement vers l'interface Vast.ai (bouton LOG de l'instance), ajoutez ces 3 lignes au tout début du champ On-start script / bash commands [...] de votre template : Code : curl https://raw.githubusercontent.com/JWhyFR/fah-v8/main/fah-netmon.sh -o fah-netmon.sh && chmod +x fah-netmon.shexemple de message au démarrage : Code : ========================================exemple de message à 3 min : Code : ----------------------------------------exemple d'alerte : Code : [05:59:41] [ALERT] DOWNLOAD (eth0): 297 MB downloaded in 5 min! (Threshold: 250MB) | Cooldown active: alert muted for at least 5 min.NB: si vous utilisez aussi le script fah-monitoring.sh , ce dernier fait un speedtest à son lancement et toutes les 12h, donc ça peut déclencher des faux positifs pour fah-netmon.sh ... à garder en tête 😉 NB2 : et certaines wu & core ou résultats de wu peuvent dépasser les seuils, donc seuils à ajuster en fonction des alertes que vous aurez exemple : Code : nohup ./fah-netmon.sh 5M=300 20M=400 60M=500 >fah-netmon.log 2>&1 &J'en ai aussi profité pour faire une page README (FR/EN) qui documente tous ces scripts : https://github.com/JWhyFR/fah-v8/ |
|
« Sujet précédent | Sujet suivant »
|