Hook

Their other posts in the index, biggest breakout first.
PLEASE STOP USING PANDAS FOR GIANT DATA SETS. IT IS EXTREMELY INEFFICIENT. IF YOU'RE NEW TO DATA SCIENCE OR YOU'VE BEEN WORKING, YOU KNOW THAT PANDAS IS AMONGST THE FAMILY OF THE BIG FOUR- NUMPY, PANDAS, MATPLOTLIB, AND SKLEARN AND THEY ALL NATIVELY WORK WITH EACH OTHER. IT'S RELIABLE. IT'S BEEN THE DEFAULT FOR OVER A DECADE. HOWEVER, EVERYTHING RUNS ON A SINGLE CORE AND IT LOVES TO HOARD MEMORY. EVEN AT WORK. I TRIED TO USE IT FOR A COUPLE MILLION ROWS AND MY RAM RED LINED. HOWEVER, THERE IS A QUICKER ALTERNATIVE, AND IT'S CALLED POLARS, AND IT'S WRITTEN IN RUST, BUILT ON APACHE ARROW, AND IT IS BLAZING FAST. WE'RE TALKING FIVE TO 10 TIMES FASTER ON BIG WORKLOADS. AND THE REASON IS BECAUSE IT USES SOMETHING CALLED LAZY EVALUATION, WHERE INSTEAD OF EXECUTING YOUR CODE LINE BY LINE AND MAKING A BUNCH OF EXPENSIVE DATA COPIES, IT WAITS, OPTIMIZES YOUR ENTIRE QUERY PLAN, AND THEN RUNS IT ACROSS ALL YOUR CPU CORES AT ONCE. THIS DOESN'T MEAN THROW PANDAS OUT OF YOUR DATA SCIENCE TOOLKIT. BECAUSE IF YOUR DATA SET FITS COMFORTABLY IN MEMORY, OR IF YOU'RE USING LIBRARIES LIKE SCIKIT-LEARN THAT EXPECTS PANDAS DATA FRAMES, YOU MIGHT AS WELL STICK WITH PANDAS. EVEN THOUGH POLARS DOES ALLOW YOU TO CONVERT THINGS TO PANDAS DATA FRAMES. HOWEVER, IF YOU'RE TRYING TO PROCESS MILLIONS OF ROWS OF DATA, OR IF YOU'RE BUILDING PRODUCTION PIPELINES, YOU MIGHT AS WELL SWITCH TO POLARS! IT WILL SAVE YOU A LOT OF WORKLOAD