הבעיה העיקרית בקריאת קבצי csv משרת אינטרנט היא שייתכן שהמפריד בשימוש בקובץ אינו זהה למפריד המשמש את Python. זה יכול להוביל לשגיאות בעת ניסיון לייבא את הנתונים לפייתון.
import csv
import urllib2
response = urllib2.urlopen('http://samplecsvs.s3.amazonaws.com/SalesJan2009.csv')
csv_file = csv.reader(response)
for row in csv_file:
print row
קוד זה מייבא את המודולים csv ו-urllib2. לאחר מכן הוא משתמש ב-urllib2 כדי לפתוח את כתובת האתר 'http://samplecsvs.s3.amazonaws.com/SalesJan2009.csv'. לאחר מכן הקוד יוצר משתנה csv_file המוגדר לפונקציה csv.reader, ומעביר את משתנה התגובה כארגומנט. לאחר מכן, הקוד משתמש בלולאת for כדי לחזור על כל שורה ב-csv_file, ומדפיס כל שורה למסוף.
קובצי CSV
קובצי CSV הם קבצי ערכים מופרדים בפסיקים. הם משמשים בדרך כלל לאחסון נתונים בפורמט טבלאי. ניתן לקרוא קבצי CSV על ידי מודול ה-CSV של Python.
טיפים לאינטרנט ו-CSV
יש כמה טיפים לעבודה עם נתוני אינטרנט ו-CSV ב-Python.
ראשית, חשוב להבין שיש שני סוגים שונים של נתונים: טקסט ובינארי. נתונים בינאריים מורכבים מ-1 ו-0, בעוד שנתוני טקסט הם רק סדרה של תווים.
כאשר עובדים עם נתונים בינאריים, חשוב להשתמש בכלים הנכונים. לדוגמה, ניתן להשתמש בספריית הפנדות לקריאה ולכתיבה של קבצים בינאריים.
שנית, חשוב לעקוב אחר שמות העמודות בעבודה עם קבצי CSV. לפייתון יש פונקציה מובנית בשם split() אשר ניתן להשתמש בה כדי לפצל קובץ לעמודות בודדות.
לבסוף, חשוב גם לזכור שקובצי CSV הם ערכים מופרדים בפסיקים (CSV). המשמעות היא שיש לציין כל עמודה בשורה נפרדת.