Odstranit duplicitní řádky
Vložit seznam s opakovanými položkami a odstranit duplikáty v jednom kroku. Zachovejte první výskyt každého řádku nebo seřaďte po deduplikaci podle abecedy.
Jak odstranit duplicitní řádky
1. Vložte text — jednu položku na řádek.
2. Zvolte, zda zachovat původní pořadí nebo seřadit řádky po odstranění duplikátů.
3. Volitelně ignorujte velká a malá písmena, aby se "Apple" a "apple" počítaly jako stejný řádek.
4. Zkopírujte vyčištěný výstup.
Příklady deduplikace
Čištění seznamu e-mailů
Export seznamu adresátů s 1200 řádky může obsahovat 340 duplikátů. Po odstranění duplicitních adres zůstane 860 jedinečných adres v pořadí jako první.
Server protokoluje jedinečné adresy IP
Vložte 5 000 řádků protokolu a ponechejte jedinečné adresy IP jednu na řádek — rychleji než řazení | uniq v terminálu pro rychlou kontrolu.
Seznam značek pro blog
"seo, marketing, SEO, obsah, marketing" rozdělené po řádcích → jedinečné značky: seo, marketing, obsah (volba bez rozlišení velkých a malých písmen spojuje SEO a seo).
Kdy použít odstranění duplicitních řádků
• Když sloučíte exporty CSV a potřebujete jedinečné hodnoty v jednom sloupci.
• Když vyčistíte vložené seznamy před importem do CRM nebo tabulky.
• Když chcete jedinečné položky z výstupu příkazu bez otevření terminálu.
Přesná shoda vs fuzzy deduplikace
Tento nástroj odstraňuje řádky, které jsou znak pro znak identické (po volitelné normalizaci velikosti písmen). Nesloučí „New York“ a „New York, NY“ nebo e-maily, které se v Gmailu liší tečkou. Pro odstranění duplicitních kontaktů nejprve normalizujte formáty — ořízněte mezery, e-maily malými písmeny, odstraňte koncovou interpunkci — a poté spusťte deduplikaci.
Časté dotazy
Odstraní prázdné řádky?
Prázdné řádky lze považovat za vzájemné duplikáty. Povolte možnosti oříznutí, pokud váš nástroj podporuje úplné odstranění prázdných řádků.
Rozlišuje se při porovnávání ve výchozím nastavení velká a malá písmena?
Obvykle můžete přepínat rozlišování malých a velkých písmen. Režim nerozlišující malá a velká písmena považuje „chyba“ a „chyba“ za stejný řádek.
Který duplikát je uchováván?
Při zachování pořadí je zachován první výskyt každého jedinečného řádku; pozdější kopie jsou odstraněny.
Dokáže zpracovat velmi velké seznamy?
Platí limity paměti prohlížeče, ale seznamy s desítkami tisíc krátkých řádků na moderních zařízeních obvykle fungují dobře.
Změní to můj původní soubor?
Ne. Vložíte text a zkopírujete výsledek — zdrojové soubory na disku se nikdy nedotknou.