Обработка на набор от данни със скриптов език
С помощта на скриптов език като Python можем бързо да обработим голям набор от данни. Вграденият модул csv чете файлове CSV, а библиотеката pandas зарежда данните в таблица (DataFrame) с read_csv. След това можем да филтрираме редове, да сортираме и да изчисляваме статистики като средна стойност (mean). Преди анализа данните се почистват: поправят се или се махат грешни, липсващи и повтарящи се записи.
Какво да запомним
- import csv: вграден модул за CSV файлове.
- pandas.read_csv("data.csv") зарежда данните в DataFrame.
- df["оценка"].mean() дава средната стойност на колоната.
- df[df["оценка"] > 5] избира редовете с оценка над 5.
- Почистване на данни: премахване на грешни, липсващи и повтарящи се записи.
Пример
df = pandas.read_csv("klas.csv"); print(df["оценка"].mean()) извежда средната оценка на класа.
Проверете се: 15 въпроса
Натиснете въпроса, за да видите верния отговор и обяснението.
В Python с библиотеката pandas: какво прави df["оценка"].mean()?
- Намира най-голямата оценка
- Брои редовете
- Сортира таблицата
- Изчислява средната стойност на колоната „оценка“
Отговор: Изчислява средната стойност на колоната „оценка“
mean() връща средното аритметично на стойностите в колоната.
Какво е „почистване на данни“?
- Изтриване на целия набор
- Форматиране на диска
- Поправяне или премахване на грешни, липсващи и повтарящи се записи
- Смяна на шрифта
Отговор: Поправяне или премахване на грешни, липсващи и повтарящи се записи
Грешните данни водят до грешни изводи, затова се почистват преди анализа.
Кой вграден модул на Python служи за четене на CSV файлове?
- math
- random
- turtle
- csv
Отговор: csv
Модулът csv чете и записва CSV файлове; math е за математика, random за случайни числа, turtle за рисуване.
Какво прави pandas.read_csv("data.csv")?
- Зарежда данните от файла в таблица (DataFrame)
- Изтрива файла
- Създава празен файл
- Изпраща файла по имейл
Отговор: Зарежда данните от файла в таблица (DataFrame)
DataFrame е таблична структура с редове и колони, с която се правят анализи.
Как в pandas се избират редовете, в които оценката е над 5?
- df["оценка" > 5]
- df[df["оценка"] > 5]
- df.mean() > 5
- df.head(5)
Отговор: df[df["оценка"] > 5]
Вътрешният израз дава True/False за всеки ред, а df[...] оставя само редовете с True.
Коя библиотека на Python често се използва за работа с таблични данни?
- pandas
- turtle
- random
- math
Отговор: pandas
pandas е създадена за четене, филтриране и анализ на таблици.
Как се нарича таблицата с данни в pandas?
- List
- DataFrame
- Tuple
- String
Отговор: DataFrame
pandas зарежда таблицата в обект DataFrame.
Как в Python се включва библиотеката pandas?
- include pandas
- use pandas
- import pandas
- load pandas
Отговор: import pandas
Библиотеки и модули се включват с ключовата дума import.
Какво прави df.head() в pandas?
- Изтрива първия ред
- Сортира таблицата
- Показва последния ред
- Показва първите редове
Отговор: Показва първите редове
head() показва началото на таблицата, по подразбиране 5 реда.
Какво дава df["оценка"].max()?
- Най-голямата оценка
- Най-малката оценка
- Средната оценка
- Броя на оценките
Отговор: Най-голямата оценка
max() връща най-голямата стойност в колоната.
Какво прави df.sort_values("оценка")?
- Изтрива колоната оценка
- Сортира по колоната оценка
- Събира оценките
- Брои оценките
Отговор: Сортира по колоната оценка
sort_values подрежда редовете по стойностите на дадена колона.
Кой израз дава броя на редовете в DataFrame df?
- df.mean()
- df.max()
- len(df)
- df.sum()
Отговор: len(df)
len(df) връща броя на записите (редовете).
Какво прави df.dropna()?
- Маха повтарящите се редове
- Маха първия ред
- Попълва празните с нули
- Маха редове с липсващи данни
Отговор: Маха редове с липсващи данни
dropna() премахва редовете, в които има липсващи стойности.
Кой метод премахва повтарящите се записи в pandas?
- df.drop_duplicates()
- df.dropna()
- df.head()
- df.mean()
Отговор: df.drop_duplicates()
drop_duplicates() оставя само по един екземпляр от еднаквите редове.
Таблицата има колони „клас“ и „оценка“. Какво дава df.groupby("клас")["оценка"].mean()?
- Общата средна оценка
- Средна оценка по класове
- Броя на класовете
- Най-високата оценка
Отговор: Средна оценка по класове
groupby групира редовете по клас, а mean() смята средната оценка за всяка група.