Všechny nástroje

Odstranit duplicitní řádky

Vložit seznam s opakovanými položkami a odstranit duplikáty v jednom kroku. Zachovejte první výskyt každého řádku nebo seřaďte po deduplikaci podle abecedy. Ideální pro čištění exportovaných e-mailů, serverových protokolů, seznamů značek a inventárních SKU. Zpracování zůstává místní — nic se nenahrává.
Vstupní text

Jak odstranit duplicitní řádky

1. Vložte text — jednu položku na řádek.
2. Zvolte, zda zachovat původní pořadí nebo seřadit řádky po odstranění duplikátů.
3. Volitelně ignorujte velká a malá písmena, aby se "Apple" a "apple" počítaly jako stejný řádek.
4. Zkopírujte vyčištěný výstup.

Příklady deduplikace

Čištění seznamu e-mailů

Export seznamu adresátů s 1200 řádky může obsahovat 340 duplikátů. Po odstranění duplicitních adres zůstane 860 jedinečných adres v pořadí jako první.

Server protokoluje jedinečné adresy IP

Vložte 5 000 řádků protokolu a ponechejte jedinečné adresy IP jednu na řádek — rychleji než řazení | uniq v terminálu pro rychlou kontrolu.

Seznam značek pro blog

"seo, marketing, SEO, obsah, marketing" rozdělené po řádcích → jedinečné značky: seo, marketing, obsah (volba bez rozlišení velkých a malých písmen spojuje SEO a seo).

Kdy použít odstranění duplicitních řádků

Když sloučíte exporty CSV a potřebujete jedinečné hodnoty v jednom sloupci.
Když vyčistíte vložené seznamy před importem do CRM nebo tabulky.
Když chcete jedinečné položky z výstupu příkazu bez otevření terminálu.

Kdy zvolit něco jiného

Když duplikáty zahrnují více sloupců a řádků — použijte tabulkový procesor nebo nástroj CSV.
Když potřebujete fuzzy párování („Jon Smith“ vs „John Smith“) — tento nástroj odpovídá pouze přesným řádkům.
Když potřebujete porovnat dva úplné dokumenty — použijte nástroj pro porovnání textu.

Přesná shoda vs fuzzy deduplikace

Tento nástroj odstraňuje řádky, které jsou znak pro znak identické (po volitelné normalizaci velikosti písmen). Nesloučí „New York“ a „New York, NY“ nebo e-maily, které se v Gmailu liší tečkou. Pro odstranění duplicitních kontaktů nejprve normalizujte formáty — ořízněte mezery, e-maily malými písmeny, odstraňte koncovou interpunkci — a poté spusťte deduplikaci.

Zachování pořadí v datových kanálech

Zachování prvního pořadí je důležité, pokud seznam odráží prioritu nebo chronologii — např. pořadí registrace nebo hodnocená klíčová slova. Řazení po odstranění je lepší, když potřebujete abecední rejstřík jedinečných kategorií. Před kopírováním výstupu do následných nástrojů zvolte režim.

Časté dotazy

Odstraní prázdné řádky?

Prázdné řádky lze považovat za vzájemné duplikáty. Povolte možnosti oříznutí, pokud váš nástroj podporuje úplné odstranění prázdných řádků.

Rozlišuje se při porovnávání ve výchozím nastavení velká a malá písmena?

Obvykle můžete přepínat rozlišování malých a velkých písmen. Režim nerozlišující malá a velká písmena považuje „chyba“ a „chyba“ za stejný řádek.

Který duplikát je uchováván?

Při zachování pořadí je zachován první výskyt každého jedinečného řádku; pozdější kopie jsou odstraněny.

Dokáže zpracovat velmi velké seznamy?

Platí limity paměti prohlížeče, ale seznamy s desítkami tisíc krátkých řádků na moderních zařízeních obvykle fungují dobře.

Změní to můj původní soubor?

Ne. Vložíte text a zkopírujete výsledek — zdrojové soubory na disku se nikdy nedotknou.

Jsou data nahraná?

Ne. Deduplikace probíhá výhradně ve vašem prohlížeči.